# Qwen3.7 Max Benchmark Scores & Performance

> Qwen3.7 Max by Alibaba scores 63.46/100 overall, ranking #43 out of 783 AI models.

Canonical page: https://benchlm.ai/models/qwen3-7-max

Last updated: October 2, 2026

## Model Details

| Property | Value |
|----------|-------|
| Creator | Alibaba |
| Source Type | Proprietary |
| Reasoning Type | Reasoning |
| Context Window | 1M |
| Overall Score | 63.46/100 |
| Overall Rank | #43 of 783 |

## Family & Coverage

- Family: Qwen3.7 Max
- Variant: base
- Benchmarks covered: 57 of 645
- Coverage note: BenchLM currently has partial benchmark coverage for this model, so the overall score is conservative.

## Agentic Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [Terminal-Bench 2.0](/benchmarks/terminal-bench-2) | 69.7% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [QwenClawBench](/benchmarks/qwenclawbench) | 64.3% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [QwenWebBench](/benchmarks/qwenwebbench) | 1568 | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [Claw-Eval](/benchmarks/claw-eval) | 65.2% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [BFCL v4](/benchmarks/bfcl-v4) | 75.0% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [MCP Atlas](/benchmarks/mcpatlas) | 76.4% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [VITA-Bench](/benchmarks/vitabench) | 47.9% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [HLE w/ tools](/benchmarks/hlewithtools) | 53.5% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [τ²-bench results](/benchmarks/tau2-bench) | 94.7% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |
| [GDPval-AA](/benchmarks/gdpvalaanormalized) | 30.7% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |
| [Gert Labs](/benchmarks/gertlabs) | 64.27% | [Gert Labs rankings](https://gertlabs.com/rankings) |
| [ResearchClawBench](/benchmarks/researchclawbench) | 18.7% | [ResearchClawBench leaderboard](https://internscience.github.io/ResearchClawBench-Home/) |
| [Terminal-Bench 2.1 (Vals)](/benchmarks/valsterminalbench21) | 61.0% | [Vals AI: Terminal-Bench 2.1 leaderboard](https://www.vals.ai/models/alibaba_qwen3.7-max) |
| [AA Agentic Index](/benchmarks/aaagenticindex) | 23.9% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |
| [GDPval-AA](/benchmarks/gdpvalaa) | 1190 | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |

## Coding Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [SWE-bench Verified](/benchmarks/swe-bench-verified) | 80.4% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [SWE-bench Pro](/benchmarks/swe-bench-pro) | 60.6% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [SWE Multilingual](/benchmarks/swe-bench-multilingual) | 78.3% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [NL2Repo](/benchmarks/nl2repo) | 47.2% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [SciCode](/benchmarks/scicode) | 53.5% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [LiveCodeBench](/benchmarks/livecodebench) | 91.6% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [Terminal-Bench 2.0](/benchmarks/terminal-bench-2) | 69.7% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [AA-SciCode](/benchmarks/aascicode) | 49.5% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |
| [OpenHarmony Bench](/benchmarks/openharmonybench) | 53.4% | [OpenHarmony Bench official leaderboard](https://bench.matrix.openharmony.cn/) |
| [LiveCodeBench (Vals)](/benchmarks/valslivecodebench) | 87.1% | [Vals AI: LiveCodeBench leaderboard](https://www.vals.ai/models/alibaba_qwen3.7-max) |
| [SWE-bench (Vals)](/benchmarks/valsswebench) | 68.8% | [Vals AI: SWE-bench leaderboard](https://www.vals.ai/models/alibaba_qwen3.7-max) |
| [AA Coding Index](/benchmarks/aacodingindex) | 66.0% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |

## Multimodal & Grounded Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [Design Arena Website](/benchmarks/designarenawebsite) | 1280 | [OpenRouter model benchmarks](https://openrouter.ai/qwen/qwen3.7-max/benchmarks) |

## Reasoning Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [MRCRv2](/benchmarks/mrcrv2) | 90.4% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [CritPt](/benchmarks/critpt) | 13.4% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [AA-LCR](/benchmarks/lcr) | 79.0% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |

## Knowledge Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [GPQA](/benchmarks/gpqa) | 92.4% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [GPQA-D](/benchmarks/gpqa-diamond) | 92.4% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [HLE](/benchmarks/hle) | 41.4% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [MMLU-Pro](/benchmarks/mmlu-pro) | 89.6% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [MMLU-Redux](/benchmarks/mmluredux) | 95% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [SuperGPQA](/benchmarks/supergpqa) | 73.6% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [MMMLU](/benchmarks/mmmlu) | 90.3% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [Artificial Analysis Intelligence Index](/benchmarks/artificialanalysis) | 29.5% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |
| [AA-GPQA Diamond](/benchmarks/aagpqadiamond) | 92.3% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |
| [AA-HLE](/benchmarks/aahle) | 40.5% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |
| [AA-Omniscience Index](/benchmarks/aaomniscienceindex) | 13.5% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |
| [AA-Omniscience Accuracy](/benchmarks/omniscienceaccuracy) | 31.1% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |
| [AA-Omniscience Hallucination Rate](/benchmarks/omnisciencehallucinationrate) | 25.6% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |
| [GPQA Diamond (Vals)](/benchmarks/valsgpqadiamond) | 90.2% | [Vals AI: GPQA Diamond leaderboard](https://www.vals.ai/models/alibaba_qwen3.7-max) |
| [MMLU-Pro (Vals)](/benchmarks/valsmmlupro) | 89.3% | [Vals AI: MMLU Pro leaderboard](https://www.vals.ai/models/alibaba_qwen3.7-max) |

## Instruction Following Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [IFEval](/benchmarks/ifeval) | 94.3% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [IFBench](/benchmarks/ifbench) | 79.1% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [AA-IFBench](/benchmarks/aaifbench) | 80.5% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/qwen3-7-max) |

## Multilingual Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [MMLU-ProX](/benchmarks/mmluprox) | 87% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [NOVA-63](/benchmarks/nova63) | 59.0% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [INCLUDE](/benchmarks/include) | 86.2% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [MAXIFE](/benchmarks/maxife) | 89.2% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [PolyMath](/benchmarks/polymath) | 86.5% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |

## Mathematics Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [HMMT Feb 2026](/benchmarks/hmmtfeb2026) | 97.1% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [IMOAnswerBench](/benchmarks/imoanswerbench) | 90.0% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |
| [Apex](/benchmarks/apex) | 44.5% | [Qwen: Qwen3.7-Max](https://qwen.ai/blog?id=qwen3.7) |

## Other Alibaba Models

- [Qwen3.8 Max](/models/qwen3-8-max) - Score: 72.12
- [Qwen3.8-Flash-Next](/models/qwen3-8-flash-next) - Score: 64.52
- [Qwen3.8-27B](/models/qwen3-8-27b) - Score: 57.58
- [Qwen3.7 Plus](/models/qwen3-7-plus) - Score: 56.55
- [Qwen3.6 Plus](/models/qwen3-6-plus) - Score: 55.21
- [Qwen 3.6 Max (preview)](/models/qwen3-6-max-preview) - Score: 53.45
- [Qwen3.5 Plus](/models/qwen3-5-plus) - Score: 49.44
- [Qwen3.6-27B](/models/qwen3-6-27b) - Score: 49.32
- [Qwen3.7 Flash](/models/qwen3-7-flash) - Score: 49.03
- [Qwen3.5-27B](/models/qwen3-5-27b) - Score: 48.33
- [Qwen3.5-35B-A3B](/models/qwen3-5-35b-a3b) - Score: 47.64
- [Qwen3.5 Flash](/models/qwen3-5-flash) - Score: 45.09
- [Qwen3.6-35B-A3B](/models/qwen3-6-35b-a3b) - Score: 44.72
- [Qwen3.5-122B-A10B](/models/qwen3-5-122b-a10b) - Score: 41.66
- [Qwen3 Max](/models/qwen3-max) - Score: 41.09
- [Qwen2.5-72B](/models/qwen2-5-72b) - Score: 30.37
- [Qwen3-Omni-30B-A3B-Instruct](/models/qwen3-omni-30b-a3b-instruct) - Score: 28.55
- [Qwen2.5 Coder 32B Instruct](/models/qwen2-5-coder-32b-instruct) - Score: 27.09
- [Qwen3 235B 2507](/models/qwen3-235b-2507) - Score: not computed
- [Qwen3.8-Omni-Flash](/models/qwen3-8-omni-flash) - Score: not computed
- [Qwen3.5 397B](/models/qwen3-5-397b) - Score: not computed
- [Qwen3 235B 2507 (Reasoning)](/models/qwen3-235b-2507-reasoning) - Score: not computed
- [Qwen3.5 397B (Reasoning)](/models/qwen3-5-397b-reasoning) - Score: not computed
- [Qwen2.5-1M](/models/qwen2-5-1m) - Score: not computed
- [Qwen2.5-VL-32B](/models/qwen2-5-vl-32b) - Score: not computed
- [Alibaba GTE Reranker ModernBERT-base](/models/gte-reranker-modernbert-base) - Score: not computed
- [Qwen3-Reranker-4B](/models/qwen3-reranker-4b) - Score: not computed
- [Qwen3.8-27B (Chutes TEE)](/models/qwen3-8-27b-chutes) - Score: not computed
- [Raw Qwen3 0.6B direct logits](/models/raw-qwen3-0-6b) - Score: not computed
- [Raw Qwen3 1.7B direct logits](/models/raw-qwen3-1-7b) - Score: not computed
- [Raw Qwen3 4B Instruct 2507 direct logits](/models/raw-qwen3-4b-instruct-2507) - Score: not computed
- [Raw Qwen3 8B direct logits](/models/raw-qwen3-8b) - Score: not computed
- [Qwen3.8 Max Preview](/models/qwen3-8-max-preview) - Score: not computed
- [Qwen3-ASR 0.6B](/models/qwen3-asr-0-6b) - Score: not computed
- [Qwen3-ASR 1.7B](/models/qwen3-asr-1-7b) - Score: not computed
- [Qwen-AgentWorld-35B-A3B](/models/qwen-agentworld-35b-a3b) - Score: not computed
- [Qwen3-Omni-30B-A3B-Thinking](/models/qwen3-omni-30b-a3b-thinking) - Score: not computed
- [Qwen2.5-Omni 7B](/models/qwen2-5-omni-7b) - Score: not computed
- [Qwen2-Audio 7B Instruct](/models/qwen2-audio-7b-instruct) - Score: not computed
- [Qwen-Audio 7B](/models/qwen-audio-7b) - Score: not computed
- [Qwen-Audio-Chat 7B](/models/qwen-audio-chat-7b) - Score: not computed
- [Qwen4 27B](/models/qwen4-27b) - Score: not computed
- [Qwen4 Flash & Plus](/models/qwen4-flash-plus) - Score: not computed
- [Qwen4 Max](/models/qwen4-max) - Score: not computed
