# Mistral Large 4 Benchmark Scores & Performance

> Mistral Large 4 by Mistral scores 53.69/100 overall, ranking #69 out of 882 AI models.

Canonical page: https://benchlm.ai/models/mistral-large-4

Last updated: October 6, 2026

## Model Details

| Property | Value |
|----------|-------|
| Creator | Mistral |
| Source Type | Pending |
| Reasoning Type | Hybrid |
| Context Window | 1M |
| Overall Score | 53.69/100 |
| Overall Rank | #69 of 882 |

## Family & Coverage

- Family: Mistral Large 4
- Variant: base
- Benchmarks covered: 18 of 613
- Related earlier model: [Mistral Large 3](/models/mistral-large-3)
- Coverage note: BenchLM currently has partial benchmark coverage for this model, so the overall score is conservative.

## Agentic Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [Cybench](/benchmarks/cybench) | 93.0% | [Mistral AI: Introducing Mistral Large 4](https://mistral.ai/news/mistral-large-4/) |
| [Finance Agent v2](/benchmarks/financeagentv2) | 54.7% | [Vals AI: Finance Agent v2](https://www.vals.ai/benchmarks/fabv2) |
| [GDPval-AA](/benchmarks/gdpvalaanormalized) | 46.2% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/mistral-large-4) |
| [AA Briefcase](/benchmarks/aabriefcaseelo) | 1393 | [Artificial Analysis: aa-briefcase leaderboard](https://artificialanalysis.ai/evaluations/aa-briefcase) |
| [AA AutomationBench](/benchmarks/aaautomationbench) | 59.9% | [Artificial Analysis: automationbench-aa leaderboard](https://artificialanalysis.ai/evaluations/automationbench-aa) |
| [GDPval-AA](/benchmarks/gdpvalaa) | 1424 | [Artificial Analysis: gdpval-aa leaderboard](https://artificialanalysis.ai/evaluations/gdpval-aa) |
| [AA Terminal-Bench 4.0](/benchmarks/terminal-bench-4) | 26.8% | [Artificial Analysis: terminalbench-v4-0 leaderboard](https://artificialanalysis.ai/evaluations/terminalbench-v4-0) |
| [GDP.pdf](/benchmarks/aagdppdf) | 18.6% | [Artificial Analysis: gdp-pdf leaderboard](https://artificialanalysis.ai/evaluations/gdp-pdf) |

## Coding Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [Vibe Code Bench](/benchmarks/vibecodebench) | 78.40% | [Vals AI: Vibe Code Bench v1.1](https://www.vals.ai/benchmarks/vibe-code) |
| [AA-SciCode](/benchmarks/aascicode) | 54.2% | [Artificial Analysis: scicode leaderboard](https://artificialanalysis.ai/evaluations/scicode) |

## Multimodal & Grounded Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [AA-MMMU-Pro](/benchmarks/mmmu-pro) | 76.4% | [Artificial Analysis: mmmu-pro leaderboard](https://artificialanalysis.ai/evaluations/mmmu-pro) |

## Reasoning Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [AA-LCR](/benchmarks/lcr) | 81.3% | [Artificial Analysis: artificial-analysis-long-context-reasoning leaderboard](https://artificialanalysis.ai/evaluations/artificial-analysis-long-context-reasoning) |
| [CritPt](/benchmarks/critpt) | 10.6% | [Artificial Analysis: critpt leaderboard](https://artificialanalysis.ai/evaluations/critpt) |

## Knowledge Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [Artificial Analysis Intelligence Index](/benchmarks/artificialanalysis) | 38.4% | [Artificial Analysis: artificial-analysis-intelligence-index leaderboard](https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index) |
| [AA-HLE](/benchmarks/aahle) | 35.0% | [Artificial Analysis: humanitys-last-exam leaderboard](https://artificialanalysis.ai/evaluations/humanitys-last-exam) |
| [AA-Omniscience Index](/benchmarks/aaomniscienceindex) | -5.3% | [Artificial Analysis: omniscience leaderboard](https://artificialanalysis.ai/evaluations/omniscience) |
| [AA-Omniscience Accuracy](/benchmarks/omniscienceaccuracy) | 25.8% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/mistral-large-4) |
| [AA-Omniscience Hallucination Rate](/benchmarks/omnisciencehallucinationrate) | 41.9% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/mistral-large-4) |

## Other Mistral Models

- [Mistral Medium 3.5 128B](/models/mistral-medium-3-5-128b) - Score: 35.37
- [Mistral Small 4](/models/mistral-small-4) - Score: 34.84
- [Mistral Large 3](/models/mistral-large-3) - Score: 33.34
- [Mistral Medium 3](/models/mistral-medium-3) - Score: 29.22
- [Mistral Large 2](/models/mistral-large-2) - Score: 28.65
- [Ministral 3 14B](/models/ministral-3-14b) - Score: 25.14
- [Ministral 3 8B](/models/ministral-3-8b) - Score: 20.26
- [Ministral 3 3B](/models/ministral-3-3b) - Score: 19.08
- [Mixtral 8x22B Instruct v0.1](/models/mixtral-8x22b-instruct-v0-1) - Score: 18.99
- [Mistral 7B v0.3](/models/mistral-7b-v0-3) - Score: 7.27
- [Ministral 3 14B (Reasoning)](/models/ministral-3-14b-reasoning) - Score: not computed
- [Mistral 8x7B](/models/mistral-8x7b) - Score: not computed
- [Ministral 3 8B (Reasoning)](/models/ministral-3-8b-reasoning) - Score: not computed
- [Ministral 3 3B (Reasoning)](/models/ministral-3-3b-reasoning) - Score: not computed
- [Mistral 8x7B v0.2](/models/mistral-8x7b-v0-2) - Score: not computed
- [Leanstral 1.5](/models/leanstral-1-5) - Score: not computed
- [Leanstral](/models/leanstral) - Score: not computed
- [Mistral Small 4 (Reasoning)](/models/mistral-small-4-reasoning) - Score: not computed
