# τ²-Bench Tool-Agent-User Evaluation (τ²-bench results)

> This route is a sourced ledger for published τ²-bench results. Most current rows come from Artificial Analysis's telecom implementation, while named provider rows can use telecom, airline, retail, or aggregate setups.

Canonical page: https://benchlm.ai/benchmarks/tau2-bench

- Category: [Agentic](/agentic)
- Last updated: September 10, 2026

## About τ²-bench results

- Year: 2025
- Tasks: Airline, retail, and telecom customer-service task sets
- Format: Published domain success or pass^k results
- Difficulty: Dual-control customer-service workflows
- Paper: [τ²-Bench: Evaluating Conversational Agents in a Dual-Control Environment](https://arxiv.org/abs/2506.07982)

τ²-bench extends the original benchmark with a dual-control telecom domain where the agent and simulated user can both act through tools. The maintained framework also includes airline and retail. BenchLM keeps each exact source attached and labels the published setup instead of treating every row as one controlled run.

τ²-bench results is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (132 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [GLM-5.2](/models/glm-5-2) | Z.AI | 99.1% |
| 2 | [GPT-5.4](/models/gpt-5-4) | OpenAI | 98.9% |
| 3 | [Claude Fable 5](/models/claude-fable) | Anthropic | 98.5% |
| 4 | [GLM-5-Turbo](/models/glm-5-turbo) | Z.AI | 98.5% |
| 5 | [GLM-5V-Turbo](/models/glm-5v-turbo) | Z.AI | 98.5% |
| 6 | [Step 3.7 Flash](/models/step-3-7-flash) | StepFun | 98.5% |
| 7 | [GLM-5](/models/glm-5) | Z.AI | 98.2% |
| 8 | [GPT-5.5](/models/gpt-5-5) | OpenAI | 98% |
| 9 | [GLM-5.1](/models/glm-5-1) | Z.AI | 97.7% |
| 10 | [Qwen3.6 Plus](/models/qwen3-6-plus) | Alibaba | 97.7% |
| 11 | [Grok 4.3](/models/grok-4-3) | xAI | 97.7% |
| 12 | [DeepSeek V4 Pro 0813](/models/deepseek-v4-pro-0813) | DeepSeek | 96.2% |
| 13 | [Kimi K2.6](/models/kimi-2-6) | Moonshot AI | 95.9% |
| 14 | [Qwen 3.6 Max (preview)](/models/qwen3-6-max-preview) | Alibaba | 95.9% |
| 15 | [GLM-4.7](/models/glm-4-7) | Z.AI | 95.9% |
| 16 | [Kimi K2.5 (Reasoning)](/models/kimi-k2-5-reasoning) | Moonshot AI | 95.9% |
| 17 | [Kimi K2.5](/models/kimi-k2-5) | Moonshot AI | 95.9% |
| 18 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | Google | 95.6% |
| 19 | [Gemini 3.5 Flash](/models/gemini-3-5-flash) | Google | 95.3% |
| 20 | [Qwen3.6-35B-A3B](/models/qwen3-6-35b-a3b) | Alibaba | 95.3% |
| 21 | [MiMo-V2-Pro](/models/mimo-v2-pro) | Xiaomi | 95% |
| 22 | [Qwen3.7 Max](/models/qwen3-7-max) | Alibaba | 94.7% |
| 23 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 94.4% |
| 24 | [MiMo-V2.5-Pro](/models/mimo-v2-5-pro) | Xiaomi | 94.2% |
| 25 | [Qwen3.6-27B](/models/qwen3-6-27b) | Alibaba | 94.2% |
| 26 | [Mistral Medium 3.5 128B](/models/mistral-medium-3-5-128b) | Mistral | 94.2% |
| 27 | [Qwen3.5-27B](/models/qwen3-5-27b) | Alibaba | 93.9% |
| 28 | [Qwen3.5-122B-A10B](/models/qwen3-5-122b-a10b) | Alibaba | 93.6% |
| 29 | [GPT-5.4 mini](/models/gpt-5-4-mini) | OpenAI | 93.4% |
| 30 | [Grok 4.1 Fast (Reasoning)](/models/grok-4-1-fast-reasoning) | xAI | 93.3% |
| 31 | [Qwen3.7 Plus](/models/qwen3-7-plus) | Alibaba | 93% |
| 32 | [GPT-5.4 nano](/models/gpt-5-4-nano) | OpenAI | 92.5% |
| 33 | [Claude Opus 4.6 (Adaptive)](/models/claude-opus-4-6-thinking) | Anthropic | 92.1% |
| 34 | [GPT-5.2-Codex](/models/gpt-5-2-codex) | OpenAI | 92.1% |
| 35 | [Muse Spark](/models/muse-spark) | Meta | 91.5% |
| 36 | [MiMo-V2-Omni](/models/mimo-v2-omni) | Xiaomi | 91.2% |
| 37 | [Kimi K2.7 Code](/models/kimi-k2-7-code) | Moonshot AI | 90.1% |
| 38 | [Trinity-Large-Preview](/models/trinity-large-preview) | Arcee AI | 90.1% |
| 39 | [Trinity-Large-Thinking](/models/trinity-large-thinking) | Arcee AI | 90.1% |
| 40 | [Claude Opus 4.5 Thinking](/models/claude-opus-4-5-thinking) | Anthropic | 89.5% |
| 41 | [Qwen3.5-35B-A3B](/models/qwen3-5-35b-a3b) | Alibaba | 89.2% |
| 42 | [MiniMax M3](/models/minimax-m3) | MiniMax | 88.9% |
| 43 | [Claude Opus 4.7 (Adaptive)](/models/claude-opus-4-7-adaptive) | Anthropic | 88.6% |
| 44 | [LFM2.5-8B-A1B](/models/lfm2-5-8b-a1b) | LiquidAI | 88.1% |
| 45 | [Gemini 3 Pro](/models/gemini-3-pro) | Google | 87.1% |
| 46 | [GPT-5 (medium)](/models/gpt-5-medium) | OpenAI | 86.5% |
| 47 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 86.3% |
| 48 | [Claude Opus 4.5](/models/claude-opus-4-5) | Anthropic | 86.3% |
| 49 | [Solar Pro 3](/models/solar-pro-3) | Upstage | 86.3% |
| 50 | [GPT-5.3 Codex](/models/gpt-5-3-codex) | OpenAI | 86% |
| 51 | [Ling 2.6 Flash](/models/ling-2-6-flash) | InclusionAI | 86% |
| 52 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 85.1% |
| 53 | [Command A+](/models/command-a-plus) | Cohere | 85% |
| 54 | [Claude Opus 4.6](/models/claude-opus-4-6) | Anthropic | 84.8% |
| 55 | [GPT-5.2](/models/gpt-5-2) | OpenAI | 84.8% |
| 56 | [GPT-5 (high)](/models/gpt-5-high) | OpenAI | 84.8% |
| 57 | [MiniMax M2.7](/models/minimax-m2-7) | MiniMax | 84.8% |
| 58 | [Qwen3.5 397B (Reasoning)](/models/qwen3-5-397b-reasoning) | Alibaba | 83.9% |
| 59 | [Qwen3.5 397B](/models/qwen3-5-397b) | Alibaba | 83.9% |
| 60 | [MiMo-V2-Flash](/models/mimo-v2-flash) | Xiaomi | 83.9% |
| 61 | [Nemotron 3 Ultra](/models/nemotron-3-ultra) | NVIDIA | 83.3% |
| 62 | [GPT-5.1-Codex-Max](/models/gpt-5-1-codex-max) | OpenAI | 83% |
| 63 | [GPT-5.1-Codex](/models/gpt-5-1-codex) | OpenAI | 83% |
| 64 | [GPT-5.1](/models/gpt-5-1) | OpenAI | 81.9% |
| 65 | [o3](/models/o3) | OpenAI | 80.7% |
| 66 | [LLaDA2.2-flash](/models/llada2-2-flash) | InclusionAI | 80.3% |
| 67 | [Claude Sonnet 4.6](/models/claude-sonnet-4-6) | Anthropic | 79.5% |
| 68 | [DeepSeek V3.2](/models/deepseek-v3-2) | DeepSeek | 78.9% |
| 69 | [Agents-A1-4B](/models/agents-a1-4b) | InternScience | 78.2% |
| 70 | [GLM-4.6](/models/glm-4-6) | Z.AI | 76.9% |
| 71 | [Grok Code Fast 1](/models/grok-code-fast-1) | xAI | 75.7% |
| 72 | [Grok 4](/models/grok-4) | xAI | 74.9% |
| 73 | [K-Exaone](/models/k-exaone) | LG AI Research | 74.3% |
| 74 | [Qwen3 Max](/models/qwen3-max) | Alibaba | 74.3% |
| 75 | [Claude Opus 4.7](/models/claude-opus-4-7) | Anthropic | 74% |
| 76 | [Claude 4.1 Opus Thinking](/models/claude-4-1-opus-thinking) | Anthropic | 71.4% |
| 77 | [Nemotron 3 Super 100B](/models/nemotron-3-super-100b) | NVIDIA | 67.8% |
| 78 | [Grok 4 Fast (Reasoning)](/models/grok-4-fast-reasoning) | xAI | 65.8% |
| 79 | [GPT-OSS 120B](/models/gpt-oss-120b) | OpenAI | 65.8% |
| 80 | [Grok 4.1 Fast](/models/grok-4-1-fast) | xAI | 63.7% |
| 81 | [o1](/models/o1) | OpenAI | 62.6% |
| 82 | [Kimi K2](/models/kimi-k2) | Moonshot AI | 61.1% |
| 83 | [GPT-OSS 20B](/models/gpt-oss-20b) | OpenAI | 60.2% |
| 84 | [Gemma 4 31B](/models/gemma-4-31b) | Google | 59.9% |
| 85 | [LLaDA2.2-mini](/models/llada2-2-mini) | InclusionAI | 57.5% |
| 86 | [Gemini 2.5 Pro](/models/gemini-2-5-pro) | Google | 54.1% |
| 87 | [GPT-4.1 mini](/models/gpt-4-1-mini) | OpenAI | 52.9% |
| 88 | [Claude 4 Sonnet](/models/claude-4-sonnet) | Anthropic | 52.3% |
| 89 | [GPT-4.1](/models/gpt-4-1) | OpenAI | 47.1% |
| 90 | [Sarvam 105B](/models/sarvam-105b) | Sarvam | 46.8% |
| 91 | [GLM-4.5-Air](/models/glm-4-5-air) | Z.AI | 46.5% |
| 92 | [Nemotron 3 Nano Omni 30B A3B](/models/nemotron-3-nano-omni-30b-a3b) | NVIDIA | 45.3% |
| 93 | [Gemma 4 26B A4B](/models/gemma-4-26b-a4b) | Google | 43.6% |
| 94 | [Gemini 3 Flash](/models/gemini-3-flash) | Google | 43.3% |
| 95 | [Mistral Small 4](/models/mistral-small-4) | Mistral | 41.2% |
| 96 | [Mistral Small 4 (Reasoning)](/models/mistral-small-4-reasoning) | Mistral | 41.2% |
| 97 | [Nemotron 3 Nano 30B](/models/nemotron-3-nano-30b) | NVIDIA | 40.9% |
| 98 | [DeepSeek V3.1 (Reasoning)](/models/deepseek-v3-1-reasoning) | DeepSeek | 37.4% |
| 99 | [North Mini Code](/models/north-mini-code-1-0) | Cohere | 37.4% |
| 100 | [DeepSeek-R1](/models/deepseek-r1) | DeepSeek | 36.5% |
| 101 | [Gemma 4 12B](/models/gemma-4-12b) | Google | 36.3% |
| 102 | [DeepSeek V3.1](/models/deepseek-v3-1) | DeepSeek | 34.8% |
| 103 | [Sarvam 30B](/models/sarvam-30b) | Sarvam | 34.5% |
| 104 | [Solar Pro 2](/models/solar-pro-2) | Upstage | 31.9% |
| 105 | [Mistral Large 2](/models/mistral-large-2) | Mistral | 30.7% |
| 106 | [o3-mini](/models/o3-mini) | OpenAI | 28.7% |
| 107 | [Ultravox v0.6 Llama 3.3 70B](/models/ultravox-v0-6-llama-3-3-70b) | Fixie AI | 26.6% |
| 108 | [GPT-4o](/models/gpt-4o) | OpenAI | 25.1% |
| 109 | [Mistral Large 3](/models/mistral-large-3) | Mistral | 24.6% |
| 110 | [Mistral Medium 3](/models/mistral-medium-3) | Mistral | 24.3% |
| 111 | [DeepSeek V3](/models/deepseek-v3) | DeepSeek | 22.8% |
| 112 | [Granite-4.0-1B](/models/granite-4-0-1b) | IBM | 22.8% |
| 113 | [Qwen3-Omni-30B-A3B-Thinking](/models/qwen3-omni-30b-a3b-thinking) | Alibaba | 21.3% |
| 114 | [Claude 3 Haiku](/models/claude-3-haiku) | Anthropic | 21.1% |
| 115 | [Gemma 4 E4B](/models/gemma-4-e4b) | Google | 20.8% |
| 116 | [Gemma 4 E2B](/models/gemma-4-e2b) | Google | 20.8% |
| 117 | [Exaone 4.0 1.2B](/models/exaone-4-0-1-2b) | LG AI Research | 20.5% |
| 118 | [Granite-4.0-H-1B](/models/granite-4-0-h-1b) | IBM | 19.6% |
| 119 | [Llama 3.1 405B](/models/llama-3-1-405b) | Meta | 19% |
| 120 | [Llama 4 Maverick](/models/llama-4-maverick) | Meta | 17.8% |
| 121 | [GPT-4.1 nano](/models/gpt-4-1-nano) | OpenAI | 17.3% |
| 122 | [Qwen3-Omni-30B-A3B-Instruct](/models/qwen3-omni-30b-a3b-instruct) | Alibaba | 16.4% |
| 123 | [Llama 4 Scout](/models/llama-4-scout) | Meta | 15.5% |
| 124 | [Gemini 2.5 Flash](/models/gemini-2-5-flash) | Google | 14.9% |
| 125 | [Granite-4.0-H-350M](/models/granite-4-0-h-350m) | IBM | 14.6% |
| 126 | [Nova Pro](/models/nova-pro) | Amazon | 14% |
| 127 | [Granite-4.0-350M](/models/granite-4-0-350m) | IBM | 13.2% |
| 128 | [Nemotron Ultra 253B](/models/nemotron-ultra-253b) | NVIDIA | 11.4% |
| 129 | [Gemma 3 27B](/models/gemma-3-27b) | Google | 10.5% |
| 130 | [LFM2.5-VL-1.6B-Extract](/models/lfm2-5-vl-1-6b-extract) | LiquidAI | 8.5% |
| 131 | [Exaone 4.0 32B](/models/exaone-4-0-32b) | LG AI Research | 4.1% |
| 132 | [Phi-4](/models/phi-4) | Microsoft | 0% |

## FAQ

### Are all τ²-bench scores directly comparable?

No. Match the domain, task release, agent model, user model, scaffold, prompts, number of trials, and pass^k definition. BenchLM labels each sourced row so a telecom result or third-party implementation is not silently treated as the same setup as an airline, retail, or aggregate result.

### Does a high τ²-bench score prove production support reliability?

No. It measures success in simulated customer-service environments under a reported setup. Production identity checks, permission boundaries, changing policies, latency, cost, monitoring, and human escalation still need separate testing.

## Compare Top Models on τ²-bench results

- [GLM-5.2 vs GPT-5.4](/compare/glm-5-2-vs-gpt-5-4)
- [GPT-5.4 vs Claude Fable 5](/compare/claude-fable-vs-gpt-5-4)
- [Claude Fable 5 vs GLM-5-Turbo](/compare/claude-fable-vs-glm-5-turbo)
- [GLM-5-Turbo vs GLM-5V-Turbo](/compare/glm-5-turbo-vs-glm-5v-turbo)
