# The AI Race

> Server-readable mirror of https://benchlm.ai/ai-race. This page summarizes the release timeline, current crown holder, and benchmark freshness without interactive controls.

## Latest Month

- Month: Sep 2026
- Crown holder: [GPT-6 Astra](/models/gpt-6-astra) by OpenAI with a score of 88.22
- Releases tracked: 45

## Current Highlights

- Best open weight: [MiMo-V2.6-Pro](/models/mimo-v2-6-pro) - 74.18 overall score
- Best near-frontier value: [Claude Sonnet 5.5](/models/claude-sonnet-5-5) - $10 output / 1M tokens
- Fastest measured: [Mercury 2.5](/models/mercury-2-5) - 677 tokens / sec
- Largest useful context: [GPT-6 Astra](/models/gpt-6-astra) - 1.05M context window

## Release Timeline

| Month | Crown | Provider | Releases | Crown Changed |
|-------|-------|----------|----------|---------------|
| Sep 2026 | [GPT-6 Astra](/models/gpt-6-astra) | OpenAI | 45 | Yes |
| Aug 2026 | [Qwen3.8 Max](/models/qwen3-8-max) | Alibaba | 50 | Yes |
| Jul 2026 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 51 | Yes |
| Jun 2026 | [Claude Fable 5](/models/claude-fable) | Anthropic | 37 | Yes |
| May 2026 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 21 | Yes |
| Apr 2026 | [GPT-5.5 Pro](/models/gpt-5-5-pro) | OpenAI | 36 | Yes |
| Mar 2026 | [GPT-5.4 Pro](/models/gpt-5-4-pro) | OpenAI | 39 | Yes |
| Feb 2026 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | Google | 22 | Yes |
| Jan 2026 | [Step 3.5 Flash](/models/step-3-5-flash) | StepFun | 10 | Yes |
| Dec 2025 | [GPT-5.2 Pro](/models/gpt-5-2-pro) | OpenAI | 17 | Yes |
| Nov 2025 | [Gemini 3 Pro](/models/gemini-3-pro) | Google | 8 | Yes |
| Oct 2025 | [MiniMax M2.5](/models/minimax-m2-5) | MiniMax | 11 | Yes |
| Sep 2025 | [Claude Sonnet 4.5](/models/claude-sonnet-4-5) | Anthropic | 6 | Yes |
| Aug 2025 | [GPT-5 (medium)](/models/gpt-5-medium) | OpenAI | 11 | Yes |
| Jul 2025 | [Grok 4](/models/grok-4) | xAI | 5 | Yes |
| Jun 2025 | [Gemini 2.5 Flash](/models/gemini-2-5-flash) | Google | 5 | Yes |
| May 2025 | [Claude 4 Sonnet](/models/claude-4-sonnet) | Anthropic | 3 | Yes |
| Apr 2025 | [o3-pro](/models/o3-pro) | OpenAI | 8 | No |

## Sep 2026 Releases

| Model | Provider | Ranked | Score | License |
|-------|----------|--------|-------|---------|
| [GPT-6 Astra](/models/gpt-6-astra) | OpenAI | Yes | 88.22 | Proprietary |
| [Claude Opus 5.5](/models/claude-opus-5-5) | Anthropic | Yes | 86.94 | Proprietary |
| [Claude Fable 5.1](/models/claude-fable-5-1) | Anthropic | Yes | 82.5 | Proprietary |
| [Claude Sonnet 5.5](/models/claude-sonnet-5-5) | Anthropic | Yes | 80.9 | Proprietary |
| [GPT-6 Sol](/models/gpt-6-sol) | OpenAI | Yes | 78.57 | Proprietary |
| [MiMo-V2.6-Pro](/models/mimo-v2-6-pro) | Xiaomi | Yes | 74.18 | Open Weight |
| [Gemini 3.8 Flash](/models/gemini-3-8-flash) | Google | Yes | 73.31 | Proprietary |
| [Step 5 Preview](/models/step-5-preview) | StepFun | Yes | 68.52 | Pending |
| [GPT-6.1 Sol](/models/gpt-6-1-sol) | OpenAI | Yes | 66.86 | Proprietary |
| [GPT-6 Luna](/models/gpt-6-luna) | OpenAI | Yes | 66.07 | Proprietary |
| [MiMo-V2.6-Flash](/models/mimo-v2-6-flash) | Xiaomi | Yes | 63.63 | Open Weight |
| [DeepSeek V4.1 Flash](/models/deepseek-v4-1-flash) | DeepSeek | Yes | 55.33 | Open Weight |
| [Ternary Bonsai 2 27B](/models/ternary-bonsai-2-27b) | Prism ML | Yes | 52.22 | Open Weight |
| [Quasar 438B](/models/quasar-438b) | Multiverse Computing | Yes | 46.11 | Proprietary |
| [Ling 3.0 Flash VL](/models/ling-3-0-flash-vl) | InclusionAI | Yes | 44.52 | Open Weight |
| [Mercury 2.5](/models/mercury-2-5) | Inception | Yes | 34.27 | Proprietary |
| [Muse Spark 1.3](/models/muse-spark-1-3) | Meta | No | 69 | Proprietary |
| [Grok 4.7](/models/grok-4-7) | xAI | No | 68 | Proprietary |
| [Qwen3.8-Omni-Flash](/models/qwen3-8-omni-flash) | Alibaba | No | 63 | Proprietary |
| [Atria Dawn Preview](/models/atria-dawn-preview) | Shanghai Artificial Intelligence Laboratory | No | 63 | Open Weight |
| [MiniCPM5-2B](/models/minicpm5-2b) | OpenBMB | No | 44 | Open Weight |
| [Ember-1](/models/ember-1) | Fireworks | No | 0 | Proprietary |
| [SWE-2](/models/swe-2) | Cognition | No | 0 | Proprietary |
| [Pareto 26.9](/models/pareto-26-9) | Unbiased | No | 0 | Proprietary |
| [North Small Translate](/models/north-small-translate-1-0) | Cohere | No | 0 | Open Weight |
| [Claude Mythos 5.1](/models/claude-mythos-5-1) | Anthropic | No | 0 | Proprietary |
| [Mercury Voice](/models/mercury-voice) | Inception | No | 0 | Proprietary |
| [ElevenLabs Eleven v4](/models/elevenlabs-eleven-v4) | ElevenLabs | No | 0 | Proprietary |
| [ElevenLabs Eleven v4 Turbo](/models/elevenlabs-eleven-v4-turbo) | ElevenLabs | No | 0 | Proprietary |
| [MiniMax M3.1 Flash Preview](/models/minimax-m3-1-flash-preview) | MiniMax | No | 0 | Proprietary |
| [Gemini 3.8 Flash TTS](/models/gemini-3-8-flash-tts) | Google | No | 0 | Proprietary |
| [Gemini 3.8 Flash-Lite TTS](/models/gemini-3-8-flash-lite-tts) | Google | No | 0 | Proprietary |
| [Parakeet Redux](/models/parakeet-redux) | Moondream | No | 0 | Open Weight |
| [Grok Voice Transcribe 2.0](/models/grok-voice-transcribe-2) | xAI | No | 0 | Proprietary |
| [Wispr Canto](/models/wispr-canto) | Wispr | No | 0 | Proprietary |
| [Gemini 3.8 Live](/models/gemini-3-8-live) | Google | No | 0 | Proprietary |
| [Gemini 3.8 Live Extended Thinking](/models/gemini-3-8-live-extended-thinking) | Google | No | 0 | Proprietary |
| [GPT-Live-1](/models/gpt-live-1) | OpenAI | No | 0 | Proprietary |
| [BR-Voice-Reasoner](/models/br-voice-reasoner) | Bairong Xdynamics | No | 0 | Open Weight |
| [MAI-Transcribe-2](/models/mai-transcribe-2) | Microsoft | No | 0 | Proprietary |
| [Gemini 3.8 Flash Cyber](/models/gemini-3-8-flash-cyber) | Google | No | 0 | Proprietary |
| [VibeVoice-ASR-Streaming 1.5B](/models/vibevoice-asr-streaming-1-5b) | Microsoft | No | 0 | Open Weight |
| [VibeVoice-ASR-Streaming 7B](/models/vibevoice-asr-streaming-7b) | Microsoft | No | 0 | Open Weight |
| [Muse Voice Transcribe](/models/muse-voice-transcribe) | Meta | No | 0 | Proprietary |
| [Phonon-2](/models/phonon-2) | Fermion Research | No | 0 | Open Weight |

## Benchmark Freshness Snapshot

| Category | Current | Refreshing | Stale | Saturated | Total |
|----------|---------|------------|-------|-----------|-------|
| Agentic | 91 | 3 | 0 | 0 | 94 |
| Coding | 61 | 3 | 1 | 1 | 65 |
| Reasoning | 26 | 1 | 3 | 1 | 30 |
| Multimodal | 61 | 7 | 1 | 0 | 69 |
| Knowledge | 50 | 3 | 4 | 1 | 57 |
| Multilingual | 12 | 2 | 1 | 0 | 15 |
| Instruction Following | 3 | 0 | 1 | 0 | 4 |
| Math | 28 | 3 | 3 | 0 | 34 |

Canonical page: https://benchlm.ai/ai-race
