Skip to main content
Radar

Every change to the models you run, with its source and its date. Releases, price changes, retirements, API changes, and incidents.Every change to the models you run, with its source.

Follow model changes
Live source snapshot

EVA-Bench

Separates enterprise task accuracy from conversational experience across realistic service scenarios.

Source snapshots refreshed
Five measurement lanesVOICE / S2S

Reasoning, task completion, conversation dynamics, experience, and latency stay separate.

Back to directory

Benchmark profile

Scope
213 scenarios; 3 enterprise domains; 12 systems
Primary metric
EVA-A accuracy and EVA-X experience
Owner
ServiceNow Research
Available evidence
Machine-readable benchmark-owner leaderboard, code, and public dataset

What it measures

Task completion
Can it follow policy, use tools, and finish a workflow?
Conversation dynamics
Can it handle turns, interruptions, ambiguity, and state?
Voice experience
Is the exchange natural, robust, and responsive?

Available results

EVA-Bench task accuracy and conversational experience by voice system.
RankSystemEVA-A passEVA-X passResponse speedArchitecture
1Scribe v2.2 Realtime + GPT-5.4 + Eleven Flash v2 (ElevenAgents)67.2%13.0%3.56scascade
2GPT Realtime 2.159.0%61.6%1.64ss2s
3Grok Voice Think Fast 1.058.8%56.9%1.54ss2s
4Gemini 3.6 Flash + Gemini 3.1 Flash TTS Preview56.2%0.0%5.81s2-part
5Gemini 3.8 Live Extended Thinking (High)54.8%73.7%1.72ss2s
6Universal 3.5 Pro + GPT-5.4 + Sonic 3.553.1%24.8%2.43scascade
7GPT Realtime 250.4%39.0%s2s
8Gemini 3.8 Live Extended Thinking (Minimal)50.1%79.3%1.64ss2s
9Scribe v2.2 Realtime + Gemini 3 Flash + TTS Conversational v3 (ElevenAgents)49.0%2.4%4.16scascade
10GPT Realtime 1.546.7%56.6%s2s
11Gemini 3.8 Live45.9%88.7%1.98ss2s
12Flux General Multi + GPT-5.4 + Sonic 3.543.1%17.6%2.93scascade
13Scribe v2.2 Realtime + Claude Haiku 4.5 + Eleven Flash v2 (ElevenAgents)41.0%81.7%1.94scascade
14GPT Realtime40.7%36.5%s2s
15Nova 3 + GPT-5.4-mini + Aura 239.5%9.6%3.42scascade
16Ink 2 + Haiku 4.5 + Sonic 3.534.8%6.6%3.33scascade
17Parakeet 1.1B CTC en-US + Gemma-4-26B + Kokoro33.1%39.5%2.58scascade
18Gemini 3.1 Flash Live29.2%58.9%s2s
19Ultravox27.0%2.9%2-part
20GPT Realtime 2.1 Mini21.6%29.2%2.14ss2s
21GPT Realtime Mini16.3%40.6%s2s

Interpretation limit

Accuracy and experience are deliberately separate axes; neither should be collapsed into the other.