# MMLU-Redux

> A harder refresh of MMLU intended to keep broad knowledge evaluation useful after the original benchmark became too easy for frontier models.

Canonical page: https://benchlm.ai/benchmarks/mmluredux

- Category: [Knowledge](/knowledge)
- Last updated: September 27, 2026

## About MMLU-Redux

- Year: 2026
- Tasks: Broad academic QA
- Format: Multiple choice questions
- Difficulty: Advanced general knowledge
- Paper: [Qwen3.6 launch benchmarks](https://qwen.ai/blog?id=qwen3.6)

MMLU-Redux is useful when MMLU itself has largely saturated. It acts as a broader knowledge sanity check with fresher or harder questions intended to preserve separation among strong general-purpose models.

MMLU-Redux is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (11 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Claude Opus 4.5](/models/claude-opus-4-5) | Anthropic | 96.6% |
| 2 | [Qwen3.7 Max](/models/qwen3-7-max) | Alibaba | 95% |
| 3 | [Qwen3.5 397B](/models/qwen3-5-397b) | Alibaba | 94.9% |
| 4 | [Qwen3.7 Plus](/models/qwen3-7-plus) | Alibaba | 94.5% |
| 5 | [Qwen3.6 Plus](/models/qwen3-6-plus) | Alibaba | 94.5% |
| 6 | [Qwen3.6-27B](/models/qwen3-6-27b) | Alibaba | 93.5% |
| 7 | [Ternary Bonsai 2 27B](/models/ternary-bonsai-2-27b) | Prism ML | 89.1% |
| 8 | [Mellum2-12B-A2.5B-Thinking](/models/mellum2-12b-a2-5b-thinking) | JetBrains | 86.2% |
| 9 | [MiniCPM5-2B](/models/minicpm5-2b) | OpenBMB | 84.7% |
| 10 | [Mellum2-12B-A2.5B-Instruct](/models/mellum2-12b-a2-5b-instruct) | JetBrains | 78.1% |
| 11 | [MiniCPM5-1B](/models/minicpm5-1b) | OpenBMB | 70.1% |

## FAQ

### What does MMLU-Redux measure?

A harder refresh of MMLU intended to keep broad knowledge evaluation useful after the original benchmark became too easy for frontier models.

### Which model scores highest on MMLU-Redux?

Claude Opus 4.5 by Anthropic currently leads with a score of 96.6% on MMLU-Redux.

### How many models are evaluated on MMLU-Redux?

11 AI models have been evaluated on MMLU-Redux on BenchLM.

### Does MMLU-Redux affect BenchLM's overall score?

Not directly. MMLU-Redux is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Compare Top Models on MMLU-Redux

- [Claude Opus 4.5 vs Qwen3.7 Max](/compare/claude-opus-4-5-vs-qwen3-7-max)
- [Qwen3.7 Max vs Qwen3.5 397B](/compare/qwen3-5-397b-vs-qwen3-7-max)
- [Qwen3.5 397B vs Qwen3.7 Plus](/compare/qwen3-5-397b-vs-qwen3-7-plus)
- [Qwen3.7 Plus vs Qwen3.6 Plus](/compare/qwen3-6-plus-vs-qwen3-7-plus)
