# Vending-Bench 2

> Tests long-horizon coherence by asking agents to operate a simulated vending-machine business for one year.

Canonical page: https://benchlm.ai/benchmarks/vendingbench2

- Category: [Agentic](/agentic)
- Last updated: September 29, 2026

## About Vending-Bench 2

- Year: 2026
- Tasks: One year of simulated autonomous business operation per run
- Format: Arithmetic mean final bank balance in USD
- Difficulty: Long-horizon agent coherence and business operation
- Paper: [Vending-Bench 2](https://andonlabs.com/evals/vending-bench-2)

Agents begin with $500 and manage product sourcing, supplier negotiation, inventory, pricing, sales, and customer requests over a 365-day simulation. The leaderboard uses arithmetic mean final bank balance by default and publishes row-level standard errors. We keep model configurations separate and exclude the benchmark from weighted rankings.

Vending-Bench 2 is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (66 models)

| Rank | Model | Configuration | Creator | Score |
|------|-------|---------------|---------|-------|
| 1 | [GPT-6 Astra](/models/gpt-6-astra) | 6 runs · SEM $1,074.48 | OpenAI | 15514.70 |
| 2 | [GPT-6 Sol](/models/gpt-6-sol) | 6 runs · SEM $1,050.68 | OpenAI | 14427.85 |
| 3 | [Claude Opus 5](/models/claude-opus-5) | 6 runs · SEM $2,093.58 | Anthropic | 11181.87 |
| 4 | [Claude Opus 4.7](/models/claude-opus-4-7) | 6 runs · SEM $1,181.31 | Anthropic | 10936.76 |
| 5 | [Grok 4.7](/models/grok-4-7) | 6 runs · SEM $651.73 | xAI | 10536.83 |
| 6 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | 5 runs · SEM $1,337.80 | OpenAI | 9619.37 |
| 7 | [Claude Opus 5.5](/models/claude-opus-5-5) | 6 runs · SEM $784.72 | Anthropic | 9235.25 |
| 8 | [Grok 4.6](/models/grok-4-6) | 4 runs · SEM $1,603.96 | xAI | 9047.03 |
| 9 | [GLM-5.2](/models/glm-5-2) | 6 runs · SEM $1,084.11 | Z.AI | 8313.78 |
| 10 | [GLM-5.3](/models/glm-5-3) | 6 runs · SEM $786.92 | Z.AI | 8163.61 |
| 11 | [Claude Opus 4.6](/models/claude-opus-4-6) | 5 runs · SEM $1,366.99 | Anthropic | 8017.59 |
| 12 | [GPT-5.5](/models/gpt-5-5) | 5 runs · SEM $1,345.98 | OpenAI | 7523.84 |
| 13 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | 5 runs · SEM $373.27 | OpenAI | 7343.21 |
| 14 | [Claude Sonnet 4.6](/models/claude-sonnet-4-6) | 5 runs · SEM $721.98 | Anthropic | 7204.14 |
| 15 | [Muse Spark 1.1](/models/muse-spark-1-1) | 6 runs · SEM $1,016.33 | Meta | 6520.47 |
| 16 | [Claude Sonnet 5](/models/claude-sonnet-5) | 6 runs · SEM $783.74 | Anthropic | 6377.70 |
| 17 | [Kimi K2.6](/models/kimi-2-6) | 5 runs · SEM $660.87 | Moonshot AI | 6204.57 |
| 18 | [GPT-5.4](/models/gpt-5-4) | 5 runs · SEM $871.10 | OpenAI | 6144.18 |
| 19 | [GPT-5.3 Codex](/models/gpt-5-3-codex) | 5 runs · SEM $795.98 | OpenAI | 5940.12 |
| 20 | [Claude Opus 4.8](/models/claude-opus-4-8) | High reasoning · 5 runs · SEM $830.67 | Anthropic | 5787.43 |
| 21 | [Claude Fable 5](/models/claude-fable) | High reasoning · 5 runs · SEM $1,074.93 | Anthropic | 5680.26 |
| 22 | [GLM-5.1](/models/glm-5-1) | 5 runs · SEM $333.62 | Z.AI | 5634.41 |
| 23 | [Gemini 3 Pro](/models/gemini-3-pro) | 5 runs · SEM $905.03 | Google | 5478.16 |
| 24 | [Claude Fable 5.1](/models/claude-fable-5-1) | 6 runs · SEM $1,244.44 | Anthropic | 5421.56 |
| 25 | [Gemini 3.5 Flash](/models/gemini-3-5-flash) | 6 runs · SEM $1,058.73 | Google | 5396.42 |
| 26 | [Kimi K3](/models/kimi-k3) | Moonshot endpoint · 6 runs · SEM $691.16 | Moonshot AI | 5165.04 |
| 27 | [Qwen 3.6 Plus](https://andonlabs.com/evals/vending-bench-2) | 5 runs · SEM $1,097.12 | Alibaba | 5114.87 |
| 28 | [Gemini 3.8 Flash](/models/gemini-3-8-flash) | 6 runs · SEM $490.16 | Google | 5093.79 |
| 29 | [Kimi K2.7 Code](/models/kimi-k2-7-code) | 5 runs · SEM $1,069.37 | Moonshot AI | 5082.94 |
| 30 | [Claude Fable 5](/models/claude-fable) | Low reasoning · 5 runs · SEM $1,225.23 | Anthropic | 5018.52 |
| 31 | [Claude Opus 4.5](/models/claude-opus-4-5) | 6 runs · SEM $979.25 | Anthropic | 4967.06 |
| 32 | [Claude Fable 5](/models/claude-fable) | Max reasoning · 5 runs · SEM $953.63 | Anthropic | 4966.64 |
| 33 | [Kimi K3](/models/kimi-k3) | Fireworks endpoint · 6 runs · SEM $1,652.42 | Moonshot AI | 4906.96 |
| 34 | [Grok 4.20](/models/grok-4-20-beta) | 6 runs · SEM $1,276.33 | xAI | 4662.85 |
| 35 | [Claude Fable 5](/models/claude-fable) | None reasoning · 5 runs · SEM $662.39 | Anthropic | 4529.94 |
| 36 | [GLM-5](/models/glm-5) | 5 runs · SEM $393.55 | Z.AI | 4432.12 |
| 37 | [Claude Fable 5](/models/claude-fable) | Medium reasoning · 4 runs · SEM $1,426.83 | Anthropic | 4339.81 |
| 38 | [Qwen 3.6 Max (preview)](/models/qwen3-6-max-preview) | 6 runs · SEM $1,469.56 | Alibaba | 4254.19 |
| 39 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | 5 runs · SEM $1,344.16 | OpenAI | 4094.71 |
| 40 | [Grok 4.5](/models/grok-4-5) | 5 runs · SEM $435.28 | xAI | 3887.43 |
| 41 | [Claude Sonnet 4.5](/models/claude-sonnet-4-5) | 5 runs · SEM $1,102.10 | Anthropic | 3838.74 |
| 42 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | Custom tools · 5 runs · SEM $1,241.57 | Google | 3774.25 |
| 43 | [Gemini 3 Flash](/models/gemini-3-flash) | 5 runs · SEM $639.34 | Google | 3634.72 |
| 44 | [GPT-5.2](/models/gpt-5-2) | 5 runs · SEM $392.08 | OpenAI | 3591.33 |
| 45 | [DeepSeek V4 Pro 0813](/models/deepseek-v4-pro-0813) | 6 runs · SEM $570.70 | DeepSeek | 3284.52 |
| 46 | [Claude Opus 4.8](/models/claude-opus-4-8) | Max reasoning · 5 runs · SEM $722.02 | Anthropic | 2992.34 |
| 47 | [GLM-4.7](/models/glm-4-7) | 5 runs · SEM $620.60 | Z.AI | 2376.82 |
| 48 | [MiniMax M3](/models/minimax-m3) | 6 runs · SEM $1,151.04 | MiniMax | 2157.77 |
| 49 | [GPT-5.1](/models/gpt-5-1) | 5 runs · SEM $756.17 | OpenAI | 1473.43 |
| 50 | [Kimi K2.5](/models/kimi-k2-5) | 5 runs · SEM $596.70 | Moonshot AI | 1198.46 |
| 51 | [Grok 4.1 Fast](/models/grok-4-1-fast) | 5 runs · SEM $457.65 | xAI | 1106.63 |
| 52 | [DeepSeek V3.2](/models/deepseek-v3-2) | 5 runs · SEM $503.15 | DeepSeek | 1034.00 |
| 53 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | 5 runs · SEM $652.55 | Google | 911.21 |
| 54 | [Gemini 2.5 Pro](/models/gemini-2-5-pro) | 5 runs · SEM $465.30 | Google | 573.64 |
| 55 | [Gemini 2.5 Flash](/models/gemini-2-5-flash) | 5 runs · SEM $365.69 | Google | 548.84 |
| 56 | [Qwen 3.5 35B A3B](https://andonlabs.com/evals/vending-bench-2) | 4 runs · SEM $486.47 | Alibaba | 462.69 |
| 57 | [Claude Haiku 4.5](/models/claude-haiku-4-5) | 5 runs · SEM $274.94 | Anthropic | 458.89 |
| 58 | [Qwen 3.5 27B](https://andonlabs.com/evals/vending-bench-2) | 5 runs · SEM $134.55 | Alibaba | 201.98 |
| 59 | [MiniMax-M2](https://andonlabs.com/evals/vending-bench-2) | 5 runs · SEM $97.40 | MiniMax | 160.60 |
| 60 | [Qwen3 Max](/models/qwen3-max) | 6 runs · SEM $94.52 | Alibaba | 71.57 |
| 61 | [Grok 4.3](/models/grok-4-3) | 6 runs · SEM $58.90 | xAI | 35.26 |
| 62 | [Qwen 3.5 Plus](https://andonlabs.com/evals/vending-bench-2) | 5 runs · SEM $20.31 | Alibaba | 0.54 |
| 63 | [Qwen3 235B A22B Thinking](https://andonlabs.com/evals/vending-bench-2) | 5 runs · SEM $14.59 | Alibaba | -11.34 |
| 64 | [GPT-OSS 120B](/models/gpt-oss-120b) | 5 runs · SEM $2.87 | OpenAI | -21.53 |
| 65 | [MiniMax M2.5](/models/minimax-m2-5) | 5 runs · SEM $0.28 | MiniMax | -23.16 |
| 66 | [GPT-5 mini](/models/gpt-5-mini) | 5 runs · SEM $5.97 | OpenAI | -31.18 |

## FAQ

### What does Vending-Bench 2 measure?

Tests long-horizon coherence by asking agents to operate a simulated vending-machine business for one year.

### Which model leads the published Vending-Bench 2 snapshot?

GPT-6 Astra currently leads the published Vending-Bench 2 snapshot with a score of 15514.70.

### How many models are evaluated on Vending-Bench 2?

The September 29, 2026 contains 66 AI models.

### Does Vending-Bench 2 affect BenchLM's overall score?

Not directly. Vending-Bench 2 is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.
