# FrontierMath v2 Tier 4 (FrontierMath v2 (Tier 4))

> Epoch AI's corrected v2 Tier 4 expansion, a separate set of exceptionally difficult research-level mathematics problems evaluated with Python-enabled iterative reasoning.

Canonical page: https://benchlm.ai/benchmarks/frontiermathv2tier4

- Category: [Mathematics](/math)
- Last updated: September 10, 2026

## About FrontierMath v2 (Tier 4)

- Year: 2026
- Tasks: 43 private extreme-difficulty mathematics problems
- Format: Python-enabled iterative mathematical problem solving
- Difficulty: Research-level mathematics requiring hours or days of expert work
- Paper: [FrontierMath Tier 4 v2 leaderboard](https://epoch.ai/benchmarks/frontiermath-tier-4-v2?view=graph&tab=leaderboard)

The v2 private Tier 4 set contains 43 problems. Its smaller sample makes individual scores noisier than Tiers 1-3, so it is a separate ranking factor with lower weight rather than being averaged into the core score.

FrontierMath v2 (Tier 4) is currently weighted in BenchLM's scoring formula. The Mathematics category carries 5% of the overall score, and FrontierMath v2 (Tier 4) contributes 10% of that category score.

## Leaderboard (45 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [GPT-6 Astra](/models/gpt-6-astra) | OpenAI | 97.600% |
| 2 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 83.000% |
| 3 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 68.300% |
| 4 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 58.500% |
| 5 | [GPT-5.5 Pro](/models/gpt-5-5-pro) | OpenAI | 39.600% |
| 6 | [GPT-5.4 Pro](/models/gpt-5-4-pro) | OpenAI | 37.500% |
| 7 | [GPT-5.5](/models/gpt-5-5) | OpenAI | 35.400% |
| 8 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 31.250% |
| 9 | [GPT-5.4](/models/gpt-5-4) | OpenAI | 27.100% |
| 10 | [Claude Opus 4.7](/models/claude-opus-4-7) | Anthropic | 22.917% |
| 11 | [Claude Opus 4.6](/models/claude-opus-4-6) | Anthropic | 22.900% |
| 12 | [GPT-5.2](/models/gpt-5-2) | OpenAI | 18.800% |
| 13 | [Gemini 3 Pro](/models/gemini-3-pro) | Google | 18.750% |
| 14 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | Google | 16.700% |
| 15 | [Muse Spark](/models/muse-spark) | Meta | 14.600% |
| 16 | [Gemini 3.5 Flash](/models/gemini-3-5-flash) | Google | 14.583% |
| 17 | [Kimi K2.6](/models/kimi-2-6) | Moonshot AI | 14.580% |
| 18 | [GLM-5.1](/models/glm-5-1) | Z.AI | 12.500% |
| 19 | [GPT-5.1](/models/gpt-5-1) | OpenAI | 12.500% |
| 20 | [Qwen3.6 Plus](/models/qwen3-6-plus) | Alibaba | 8.333% |
| 21 | [Claude Sonnet 4.6](/models/claude-sonnet-4-6) | Anthropic | 8.300% |
| 22 | [GPT-5.4 nano](/models/gpt-5-4-nano) | OpenAI | 6.250% |
| 23 | [o4-mini (high)](/models/o4-mini-high) | OpenAI | 6.250% |
| 24 | [Kimi K2.5](/models/kimi-k2-5) | Moonshot AI | 4.200% |
| 25 | [Qwen 3.6 Max (preview)](/models/qwen3-6-max-preview) | Alibaba | 4.167% |
| 26 | [Gemini 3 Flash](/models/gemini-3-flash) | Google | 4.167% |
| 27 | [Claude Opus 4.5](/models/claude-opus-4-5) | Anthropic | 4.167% |
| 28 | [Gemini 2.5 Pro](/models/gemini-2-5-pro) | Google | 4.167% |
| 29 | [Claude Sonnet 4.5](/models/claude-sonnet-4-5) | Anthropic | 4.167% |
| 30 | [Gemini 2.5 Flash](/models/gemini-2-5-flash) | Google | 4.167% |
| 31 | [GLM-4.6](/models/glm-4-6) | Z.AI | 2.128% |
| 32 | [GLM-5](/models/glm-5) | Z.AI | 2.100% |
| 33 | [DeepSeek V3.2](/models/deepseek-v3-2) | DeepSeek | 2.100% |
| 34 | [Grok 4](/models/grok-4) | xAI | 2.083% |
| 35 | [Claude Haiku 4.5](/models/claude-haiku-4-5) | Anthropic | 2.083% |
| 36 | [Qwen3.5 Plus](/models/qwen3-5-plus) | Alibaba | 2.083% |
| 37 | [o3](/models/o3) | OpenAI | 2.083% |
| 38 | [GPT-5.4 mini](/models/gpt-5-4-mini) | OpenAI | 2.080% |
| 39 | [GLM-4.7](/models/glm-4-7) | Z.AI | 0.000% |
| 40 | [Qwen3.5 Flash](/models/qwen3-5-flash) | Alibaba | 0.000% |
| 41 | [Qwen3 235B 2507 (Reasoning)](/models/qwen3-235b-2507-reasoning) | Alibaba | 0.000% |
| 42 | [Grok 3 [Beta]](/models/grok-3-beta) | xAI | 0.000% |
| 43 | [GPT-4.1](/models/gpt-4-1) | OpenAI | 0.000% |
| 44 | [Claude 3.5 Sonnet](/models/claude-3-5-sonnet) | Anthropic | 0.000% |
| 45 | [Kimi K2](/models/kimi-k2) | Moonshot AI | 0.000% |

## FAQ

### What does FrontierMath v2 (Tier 4) measure?

Epoch AI's corrected v2 Tier 4 expansion, a separate set of exceptionally difficult research-level mathematics problems evaluated with Python-enabled iterative reasoning.

### Which model scores highest on FrontierMath v2 (Tier 4)?

GPT-6 Astra by OpenAI currently leads with a score of 97.600% on FrontierMath v2 (Tier 4).

### How many models are evaluated on FrontierMath v2 (Tier 4)?

45 AI models have been evaluated on FrontierMath v2 (Tier 4) on BenchLM.

### Does FrontierMath v2 (Tier 4) affect BenchLM's overall score?

Yes. FrontierMath v2 (Tier 4) is a weighted benchmark inside the Mathematics category, which carries 5% of BenchLM's overall score. FrontierMath v2 (Tier 4) itself contributes 10% of that category score.

## Compare Top Models on FrontierMath v2 (Tier 4)

- [GPT-6 Astra vs GPT-5.6 Sol](/compare/gpt-5-6-sol-vs-gpt-6-astra)
- [GPT-5.6 Sol vs GPT-5.6 Terra](/compare/gpt-5-6-sol-vs-gpt-5-6-terra)
- [GPT-5.6 Terra vs GPT-5.6 Luna](/compare/gpt-5-6-luna-vs-gpt-5-6-terra)
- [GPT-5.6 Luna vs GPT-5.5 Pro](/compare/gpt-5-5-pro-vs-gpt-5-6-luna)
