# SuperGPQA: Scaling LLM Evaluation Across 285 Graduate Disciplines (SuperGPQA)

> An expanded version of GPQA that evaluates graduate-level knowledge and reasoning capabilities across 285 disciplines, providing comprehensive coverage of academic domains.

Canonical page: https://benchlm.ai/benchmarks/supergpqa

- Category: [Knowledge](/knowledge)
- Last updated: September 15, 2026

## About SuperGPQA

- Year: 2025
- Tasks: 285 disciplines
- Format: Multiple choice questions
- Difficulty: Graduate level
- Paper: [SuperGPQA: Scaling LLM Evaluation Across 285 Graduate Disciplines](https://arxiv.org/abs/2502.14739)

SuperGPQA significantly expands the scope of graduate-level evaluation by covering 285 disciplines compared to GPQA's focus on 3 subjects. It maintains the same rigorous standards while providing broader coverage of academic knowledge.

SuperGPQA is currently weighted in BenchLM's scoring formula. The Knowledge category carries 12% of the overall score, and SuperGPQA contributes 7% of that category score.

## Leaderboard (20 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Claude Opus 4.6](/models/claude-opus-4-6) | Anthropic | 95% |
| 2 | [Claude Sonnet 4.6](/models/claude-sonnet-4-6) | Anthropic | 95% |
| 3 | [Qwen 3.6 Max (preview)](/models/qwen3-6-max-preview) | Alibaba | 73.9% |
| 4 | [Qwen3.7 Max](/models/qwen3-7-max) | Alibaba | 73.6% |
| 5 | [Qwen3.6 Plus](/models/qwen3-6-plus) | Alibaba | 71.6% |
| 6 | [Qwen3.7 Plus](/models/qwen3-7-plus) | Alibaba | 71.4% |
| 7 | [Seed 2.1 Pro](/models/seed-2-1-pro) | ByteDance | 70.8% |
| 8 | [Claude Opus 4.5](/models/claude-opus-4-5) | Anthropic | 70.6% |
| 9 | [Qwen3.5 397B](/models/qwen3-5-397b) | Alibaba | 70.4% |
| 10 | [Kimi K2.5](/models/kimi-k2-5) | Moonshot AI | 69.2% |
| 11 | [Seed 2.1 Turbo](/models/seed-2-1-turbo) | ByteDance | 67.4% |
| 12 | [Qwen3.5-122B-A10B](/models/qwen3-5-122b-a10b) | Alibaba | 67.1% |
| 13 | [GLM-5](/models/glm-5) | Z.AI | 66.8% |
| 14 | [Qwen3.6-27B](/models/qwen3-6-27b) | Alibaba | 66% |
| 15 | [Qwen3.5-27B](/models/qwen3-5-27b) | Alibaba | 65.6% |
| 16 | [Qwen3.6-35B-A3B](/models/qwen3-6-35b-a3b) | Alibaba | 64.7% |
| 17 | [Qwen3.5-35B-A3B](/models/qwen3-5-35b-a3b) | Alibaba | 63.4% |
| 18 | [Qwen3 235B 2507](/models/qwen3-235b-2507) | Alibaba | 62.6% |
| 19 | [MiniCPM5-2B](/models/minicpm5-2b) | OpenBMB | 40.8% |
| 20 | [MiniCPM5-1B](/models/minicpm5-1b) | OpenBMB | 23.1% |

## FAQ

### What does SuperGPQA measure?

An expanded version of GPQA that evaluates graduate-level knowledge and reasoning capabilities across 285 disciplines, providing comprehensive coverage of academic domains.

### Which model scores highest on SuperGPQA?

Claude Opus 4.6 by Anthropic currently leads with a score of 95% on SuperGPQA.

### How many models are evaluated on SuperGPQA?

20 AI models have been evaluated on SuperGPQA on BenchLM.

### Does SuperGPQA affect BenchLM's overall score?

Yes. SuperGPQA is a weighted benchmark inside the Knowledge category, which carries 12% of BenchLM's overall score. SuperGPQA itself contributes 7% of that category score.

## Compare Top Models on SuperGPQA

- [Claude Opus 4.6 vs Claude Sonnet 4.6](/compare/claude-opus-4-6-vs-claude-sonnet-4-6)
- [Claude Sonnet 4.6 vs Qwen 3.6 Max (preview)](/compare/claude-sonnet-4-6-vs-qwen3-6-max-preview)
- [Qwen 3.6 Max (preview) vs Qwen3.7 Max](/compare/qwen3-6-max-preview-vs-qwen3-7-max)
- [Qwen3.7 Max vs Qwen3.6 Plus](/compare/qwen3-6-plus-vs-qwen3-7-max)

## Related Reading

- [SuperGPQA benchmark explainer](/blog/posts/gpqa-diamond-science-benchmark)
