# FrontierMath v2 Tiers 1-3 (FrontierMath v2 (Tiers 1-3))

> Epoch AI's corrected v2 core FrontierMath suite of private advanced mathematics problems. Models can reason iteratively and use Python; scores are pass rates on the private set.

Canonical page: https://benchlm.ai/benchmarks/frontiermathv2tiers13

- Category: [Mathematics](/math)
- Last updated: September 10, 2026

## About FrontierMath v2 (Tiers 1-3)

- Year: 2026
- Tasks: 295 private advanced mathematics problems
- Format: Python-enabled iterative mathematical problem solving
- Difficulty: From olympiad-plus to early research mathematics
- Paper: [FrontierMath v2 benchmark hub](https://epoch.ai/benchmarks/frontiermath-tier-4-v2)

After Epoch AI's June 2026 correction, the FrontierMath v2 private core contains 295 Tiers 1-3 problems. BenchLM selects the highest published reasoning-effort result for each model and keeps this core score distinct from Tier 4.

FrontierMath v2 (Tiers 1-3) is currently weighted in BenchLM's scoring formula. The Mathematics category carries 5% of the overall score, and FrontierMath v2 (Tiers 1-3) contributes 30% of that category score.

## Leaderboard (51 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 89.000% |
| 2 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 84.900% |
| 3 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 78.600% |
| 4 | [GPT-5.5](/models/gpt-5-5) | OpenAI | 51.700% |
| 5 | [GPT-5.5 Pro](/models/gpt-5-5-pro) | OpenAI | 51.000% |
| 6 | [GPT-5.4 Pro](/models/gpt-5-4-pro) | OpenAI | 50.000% |
| 7 | [GPT-5.4](/models/gpt-5-4) | OpenAI | 47.600% |
| 8 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 47.241% |
| 9 | [Claude Opus 4.7](/models/claude-opus-4-7) | Anthropic | 43.793% |
| 10 | [Claude Opus 4.6](/models/claude-opus-4-6) | Anthropic | 40.700% |
| 11 | [GPT-5.2](/models/gpt-5-2) | OpenAI | 40.700% |
| 12 | [Muse Spark](/models/muse-spark) | Meta | 39.000% |
| 13 | [Gemini 3.5 Flash](/models/gemini-3-5-flash) | Google | 38.966% |
| 14 | [Kimi K2.6](/models/kimi-2-6) | Moonshot AI | 38.966% |
| 15 | [Gemini 3 Pro](/models/gemini-3-pro) | Google | 37.600% |
| 16 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | Google | 36.900% |
| 17 | [Gemini 3 Flash](/models/gemini-3-flash) | Google | 35.640% |
| 18 | [GLM-5.1](/models/glm-5-1) | Z.AI | 33.448% |
| 19 | [Claude Sonnet 4.6](/models/claude-sonnet-4-6) | Anthropic | 32.400% |
| 20 | [GPT-5.1](/models/gpt-5-1) | OpenAI | 31.034% |
| 21 | [GPT-5.4 mini](/models/gpt-5-4-mini) | OpenAI | 28.280% |
| 22 | [Kimi K2.5](/models/kimi-k2-5) | Moonshot AI | 27.900% |
| 23 | [Qwen3.6 Plus](/models/qwen3-6-plus) | Alibaba | 26.207% |
| 24 | [GPT-5.4 nano](/models/gpt-5-4-nano) | OpenAI | 25.860% |
| 25 | [o4-mini (high)](/models/o4-mini-high) | OpenAI | 24.828% |
| 26 | [Qwen 3.6 Max (preview)](/models/qwen3-6-max-preview) | Alibaba | 23.103% |
| 27 | [DeepSeek V3.2](/models/deepseek-v3-2) | DeepSeek | 22.100% |
| 28 | [Kimi K2](/models/kimi-k2) | Moonshot AI | 21.404% |
| 29 | [Qwen3.5 Plus](/models/qwen3-5-plus) | Alibaba | 21.034% |
| 30 | [Claude Opus 4.5](/models/claude-opus-4-5) | Anthropic | 20.690% |
| 31 | [Grok 4](/models/grok-4) | xAI | 19.655% |
| 32 | [o3](/models/o3) | OpenAI | 18.685% |
| 33 | [GLM-5](/models/glm-5) | Z.AI | 16.434% |
| 34 | [Gemini 2.5 Pro](/models/gemini-2-5-pro) | Google | 14.138% |
| 35 | [Claude Sonnet 4.5](/models/claude-sonnet-4-5) | Anthropic | 13.495% |
| 36 | [o1](/models/o1) | OpenAI | 9.310% |
| 37 | [Qwen3 235B 2507 (Reasoning)](/models/qwen3-235b-2507-reasoning) | Alibaba | 8.481% |
| 38 | [Qwen3.5 Flash](/models/qwen3-5-flash) | Alibaba | 6.207% |
| 39 | [Claude Haiku 4.5](/models/claude-haiku-4-5) | Anthropic | 5.903% |
| 40 | [GPT-4.1](/models/gpt-4-1) | OpenAI | 5.517% |
| 41 | [Gemini 2.5 Flash](/models/gemini-2-5-flash) | Google | 4.844% |
| 42 | [GPT-4.1 mini](/models/gpt-4-1-mini) | OpenAI | 4.483% |
| 43 | [GLM-4.6](/models/glm-4-6) | Z.AI | 3.819% |
| 44 | [Grok 3 [Beta]](/models/grok-3-beta) | xAI | 3.793% |
| 45 | [GLM-4.7](/models/glm-4-7) | Z.AI | 2.439% |
| 46 | [Claude 3.5 Sonnet](/models/claude-3-5-sonnet) | Anthropic | 2.069% |
| 47 | [DeepSeek V3](/models/deepseek-v3) | DeepSeek | 1.724% |
| 48 | [GPT-4.1 nano](/models/gpt-4-1-nano) | OpenAI | 1.034% |
| 49 | [Llama 4 Maverick](/models/llama-4-maverick) | Meta | 0.690% |
| 50 | [GPT-4o](/models/gpt-4o) | OpenAI | 0.345% |
| 51 | [Llama 4 Scout](/models/llama-4-scout) | Meta | 0.000% |

## FAQ

### What does FrontierMath v2 (Tiers 1-3) measure?

Epoch AI's corrected v2 core FrontierMath suite of private advanced mathematics problems. Models can reason iteratively and use Python; scores are pass rates on the private set.

### Which model scores highest on FrontierMath v2 (Tiers 1-3)?

GPT-5.6 Sol by OpenAI currently leads with a score of 89.000% on FrontierMath v2 (Tiers 1-3).

### How many models are evaluated on FrontierMath v2 (Tiers 1-3)?

51 AI models have been evaluated on FrontierMath v2 (Tiers 1-3) on BenchLM.

### Does FrontierMath v2 (Tiers 1-3) affect BenchLM's overall score?

Yes. FrontierMath v2 (Tiers 1-3) is a weighted benchmark inside the Mathematics category, which carries 5% of BenchLM's overall score. FrontierMath v2 (Tiers 1-3) itself contributes 30% of that category score.

## Compare Top Models on FrontierMath v2 (Tiers 1-3)

- [GPT-5.6 Sol vs GPT-5.6 Terra](/compare/gpt-5-6-sol-vs-gpt-5-6-terra)
- [GPT-5.6 Terra vs GPT-5.6 Luna](/compare/gpt-5-6-luna-vs-gpt-5-6-terra)
- [GPT-5.6 Luna vs GPT-5.5](/compare/gpt-5-5-vs-gpt-5-6-luna)
- [GPT-5.5 vs GPT-5.5 Pro](/compare/gpt-5-5-vs-gpt-5-5-pro)
