# MMLU-ProX

> A multilingual extension of professional-level academic evaluation across many languages.

Canonical page: https://benchlm.ai/benchmarks/mmluprox

- Category: [Multilingual](/multilingual)
- Last updated: September 18, 2026

## About MMLU-ProX

- Year: 2025
- Tasks: Multilingual professional QA
- Format: Multilingual multiple choice
- Difficulty: Professional multilingual
- Paper: [MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation](https://arxiv.org/abs/2503.10497)

MMLU-ProX expands multilingual evaluation beyond translated arithmetic, making it a better signal for broad cross-lingual reasoning and knowledge.

MMLU-ProX is currently weighted in BenchLM's scoring formula. The Multilingual category carries 7% of the overall score, and MMLU-ProX contributes 100% of that category score.

## Leaderboard (12 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Qwen3.7 Max](/models/qwen3-7-max) | Alibaba | 87% |
| 2 | [Claude Opus 4.5](/models/claude-opus-4-5) | Anthropic | 85.7% |
| 3 | [Qwen3.7 Plus](/models/qwen3-7-plus) | Alibaba | 85.4% |
| 4 | [Qwen3.6 Plus](/models/qwen3-6-plus) | Alibaba | 84.7% |
| 5 | [Qwen3.5 397B](/models/qwen3-5-397b) | Alibaba | 84.7% |
| 6 | [GLM-5](/models/glm-5) | Z.AI | 83.1% |
| 7 | [Nemotron 3 Ultra](/models/nemotron-3-ultra) | NVIDIA | 83% |
| 8 | [Kimi K2.5](/models/kimi-k2-5) | Moonshot AI | 82.3% |
| 9 | [Qwen3.5-27B](/models/qwen3-5-27b) | Alibaba | 82.2% |
| 10 | [Qwen3.5-122B-A10B](/models/qwen3-5-122b-a10b) | Alibaba | 82.2% |
| 11 | [Qwen3.5-35B-A3B](/models/qwen3-5-35b-a3b) | Alibaba | 81% |
| 12 | [Qwen3 235B 2507](/models/qwen3-235b-2507) | Alibaba | 79.4% |

## FAQ

### What does MMLU-ProX measure?

A multilingual extension of professional-level academic evaluation across many languages.

### Which model scores highest on MMLU-ProX?

Qwen3.7 Max by Alibaba currently leads with a score of 87% on MMLU-ProX.

### How many models are evaluated on MMLU-ProX?

12 AI models have been evaluated on MMLU-ProX on BenchLM.

### Does MMLU-ProX affect BenchLM's overall score?

Yes. MMLU-ProX is a weighted benchmark inside the Multilingual category, which carries 7% of BenchLM's overall score. MMLU-ProX itself contributes 100% of that category score.

## Compare Top Models on MMLU-ProX

- [Qwen3.7 Max vs Claude Opus 4.5](/compare/claude-opus-4-5-vs-qwen3-7-max)
- [Claude Opus 4.5 vs Qwen3.7 Plus](/compare/claude-opus-4-5-vs-qwen3-7-plus)
- [Qwen3.7 Plus vs Qwen3.6 Plus](/compare/qwen3-6-plus-vs-qwen3-7-plus)
- [Qwen3.6 Plus vs Qwen3.5 397B](/compare/qwen3-5-397b-vs-qwen3-6-plus)
