# Mistral Medium 3.5 128B Benchmark Scores & Performance

> Mistral Medium 3.5 128B by Mistral scores 30.13/100 overall, ranking #213 out of 483 AI models.

Canonical page: https://benchlm.ai/models/mistral-medium-3-5-128b

Last updated: September 10, 2026

## Model Details

| Property | Value |
|----------|-------|
| Creator | Mistral |
| Source Type | Open Weight |
| Reasoning Type | Reasoning |
| Context Window | 256K |
| Overall Score | 30.13/100 |
| Overall Rank | #213 of 483 |

## Family & Coverage

- Family: Mistral Medium 3.5
- Variant: 128b
- Benchmarks covered: 27 of 434
- Coverage note: BenchLM currently has partial benchmark coverage for this model, so the overall score is conservative.

## Agentic Benchmarks

| Benchmark | Score |
|-----------|-------|
| [τ³-bench results](/benchmarks/tau3-bench) | 91.4% |
| [τ²-bench results](/benchmarks/tau2-bench) | 94.2% |
| [GDPval-AA](/benchmarks/gdpvalaanormalized) | 18.8% |
| [Gert Labs](/benchmarks/gertlabs) | 39.10% |
| [AA EnterpriseOps-Gym](/benchmarks/aaenterpriseopsgym) | 33.7% |
| [AA Harvey LAB](/benchmarks/aaharveylab) | 69.1% |
| [terminalBenchHard](/benchmarks/terminal-bench-hard) | 33.3% |
| [Terminal-Bench 2.1 (Vals)](/benchmarks/valsterminalbench21) | 39.0% |
| [AA Agentic Index](/benchmarks/aaagenticindex) | 9.3% |
| [GDPval-AA](/benchmarks/gdpvalaa) | 875 |
| [AA-AnalystAgent](/benchmarks/aaanalystagent) | 12.5% |

## Coding Benchmarks

| Benchmark | Score |
|-----------|-------|
| [SWE-bench Verified](/benchmarks/swe-bench-verified) | 77.6% |
| [AA-SciCode](/benchmarks/aascicode) | 40.2% |
| [SWE-bench (Vals)](/benchmarks/valsswebench) | 66.4% |
| [AA Coding Index](/benchmarks/aacodingindex) | 46.9% |

## Multimodal & Grounded Benchmarks

| Benchmark | Score |
|-----------|-------|
| [AA-MMMU-Pro](/benchmarks/aammmupro) | 64.9% |

## Reasoning Benchmarks

| Benchmark | Score |
|-----------|-------|
| [AA-LCR](/benchmarks/lcr) | 69.3% |
| [CritPt](/benchmarks/critpt) | 0.0% |

## Knowledge Benchmarks

| Benchmark | Score |
|-----------|-------|
| [Artificial Analysis Intelligence Index](/benchmarks/artificialanalysis) | 14.9% |
| [AA-GPQA Diamond](/benchmarks/aagpqadiamond) | 74.8% |
| [AA-HLE](/benchmarks/aahle) | 13.8% |
| [AA-Omniscience Index](/benchmarks/aaomniscienceindex) | -36.8% |
| [AA-Omniscience Accuracy](/benchmarks/omniscienceaccuracy) | 24.7% |
| [AA-Omniscience Hallucination Rate](/benchmarks/omnisciencehallucinationrate) | 81.6% |
| [GPQA Diamond (Vals)](/benchmarks/valsgpqadiamond) | 34.8% |
| [MMLU-Pro (Vals)](/benchmarks/valsmmlupro) | 75.3% |

## Instruction Following Benchmarks

| Benchmark | Score |
|-----------|-------|
| [AA-IFBench](/benchmarks/aaifbench) | 68.8% |

## Other Mistral Models

- [Ministral 3 14B (Reasoning)](/models/ministral-3-14b-reasoning) - Score: 47.18
- [Mistral Large 3](/models/mistral-large-3) - Score: 45.61
- [Mistral Small 4](/models/mistral-small-4) - Score: 42.97
- [Mistral 8x7B](/models/mistral-8x7b) - Score: 42.91
- [Ministral 3 8B (Reasoning)](/models/ministral-3-8b-reasoning) - Score: 38.41
- [Ministral 3 3B (Reasoning)](/models/ministral-3-3b-reasoning) - Score: 37.56
- [Mistral 8x7B v0.2](/models/mistral-8x7b-v0-2) - Score: 37.19
- [Mistral Large 2](/models/mistral-large-2) - Score: 36.41
- [Mistral Medium 3](/models/mistral-medium-3) - Score: 30.55
- [Ministral 3 14B](/models/ministral-3-14b) - Score: 30.27
- [Mixtral 8x22B Instruct v0.1](/models/mixtral-8x22b-instruct-v0-1) - Score: 26.65
- [Ministral 3 8B](/models/ministral-3-8b) - Score: 17.87
- [Ministral 3 3B](/models/ministral-3-3b) - Score: 16.04
- [Mistral 7B v0.3](/models/mistral-7b-v0-3) - Score: 8.66
- [Leanstral 1.5](/models/leanstral-1-5) - Score: not computed
- [Leanstral](/models/leanstral) - Score: not computed
- [Mistral Small 4 (Reasoning)](/models/mistral-small-4-reasoning) - Score: not computed
