Live source snapshot
EVA-Bench
Separates enterprise task accuracy from conversational experience across realistic service scenarios.
Source snapshots refreshed
Five measurement lanesVOICE / S2S
Reasoning, task completion, conversation dynamics, experience, and latency stay separate.
Benchmark profile
- Scope
- 213 scenarios; 3 enterprise domains; 12 systems
- Primary metric
- EVA-A accuracy and EVA-X experience
- Owner
- ServiceNow Research
- Available evidence
- Machine-readable benchmark-owner leaderboard, code, and public dataset
What it measures
Task completion
Can it follow policy, use tools, and finish a workflow?
Conversation dynamics
Can it handle turns, interruptions, ambiguity, and state?
Voice experience
Is the exchange natural, robust, and responsive?
Available results
| Rank | System | EVA-A pass | EVA-X pass | Response speed | Architecture |
|---|---|---|---|---|---|
| 1 | Scribe v2.2 Realtime + GPT-5.4 + Eleven Flash v2 (ElevenAgents) | 67.2% | 13.0% | 3.56s | cascade |
| 2 | GPT Realtime 2.1 | 59.0% | 61.6% | 1.64s | s2s |
| 3 | Grok Voice Think Fast 1.0 | 58.8% | 56.9% | 1.54s | s2s |
| 4 | Gemini 3.6 Flash + Gemini 3.1 Flash TTS Preview | 56.2% | 0.0% | 5.81s | 2-part |
| 5 | Gemini 3.8 Live Extended Thinking (High) | 54.8% | 73.7% | 1.72s | s2s |
| 6 | Universal 3.5 Pro + GPT-5.4 + Sonic 3.5 | 53.1% | 24.8% | 2.43s | cascade |
| 7 | GPT Realtime 2 | 50.4% | 39.0% | — | s2s |
| 8 | Gemini 3.8 Live Extended Thinking (Minimal) | 50.1% | 79.3% | 1.64s | s2s |
| 9 | Scribe v2.2 Realtime + Gemini 3 Flash + TTS Conversational v3 (ElevenAgents) | 49.0% | 2.4% | 4.16s | cascade |
| 10 | GPT Realtime 1.5 | 46.7% | 56.6% | — | s2s |
| 11 | Gemini 3.8 Live | 45.9% | 88.7% | 1.98s | s2s |
| 12 | Flux General Multi + GPT-5.4 + Sonic 3.5 | 43.1% | 17.6% | 2.93s | cascade |
| 13 | Scribe v2.2 Realtime + Claude Haiku 4.5 + Eleven Flash v2 (ElevenAgents) | 41.0% | 81.7% | 1.94s | cascade |
| 14 | GPT Realtime | 40.7% | 36.5% | — | s2s |
| 15 | Nova 3 + GPT-5.4-mini + Aura 2 | 39.5% | 9.6% | 3.42s | cascade |
| 16 | Ink 2 + Haiku 4.5 + Sonic 3.5 | 34.8% | 6.6% | 3.33s | cascade |
| 17 | Parakeet 1.1B CTC en-US + Gemma-4-26B + Kokoro | 33.1% | 39.5% | 2.58s | cascade |
| 18 | Gemini 3.1 Flash Live | 29.2% | 58.9% | — | s2s |
| 19 | Ultravox | 27.0% | 2.9% | — | 2-part |
| 20 | GPT Realtime 2.1 Mini | 21.6% | 29.2% | 2.14s | s2s |
| 21 | GPT Realtime Mini | 16.3% | 40.6% | — | s2s |
Interpretation limit
Accuracy and experience are deliberately separate axes; neither should be collapsed into the other.