# Claude Opus 5 Benchmark Scores & Performance

> Claude Opus 5 by Anthropic scores 80.66/100 overall, ranking #4 out of 411 AI models.

Canonical page: https://benchlm.ai/models/claude-opus-5

Last updated: September 4, 2026

## Model Details

| Property | Value |
|----------|-------|
| Creator | Anthropic |
| Source Type | Proprietary |
| Reasoning Type | Reasoning |
| Context Window | Coming soon |
| Official model card | [Claude Opus 5 System Card](https://www-cdn.anthropic.com/c5fbac3f0b1280a933ebd26d3cb8bb9f5bdeaf48/Claude%20Opus%205%20System%20Card.pdf) |
| Overall Score | 80.66/100 |
| Overall Rank | #4 of 411 |

## Family & Coverage

- Family: Claude Opus 5
- Variant: base
- Benchmarks covered: 93 of 422
- Related earlier model: [Claude Opus 4.8](/models/claude-opus-4-8)
- Coverage note: BenchLM currently has partial benchmark coverage for this model, so the overall score is conservative.

## Agentic Benchmarks

| Benchmark | Score |
|-----------|-------|
| [Terminal-Bench 3.0](/benchmarks/terminal-bench-3) | 42.7% |
| [BrowseComp](/benchmarks/browsecomp) | 90.8% |
| [HLE w/ tools](/benchmarks/hlewithtools) | 64.7% |
| [DeepSearchQA](/benchmarks/deepsearchqa) | 95.0% |
| [DRACO](/benchmarks/draco) | 88.6% |
| [BrowseComp (10-agent, prerelease)](/benchmarks/multiagentbrowsecompprerelease) | 93.6% |
| [OSWorld 2.0](/benchmarks/osworld2) | 70.6% |
| [MCP Atlas](/benchmarks/mcpatlas) | 85.8% |
| [MCP-Atlas claim coverage](/benchmarks/mcpatlasclaimcoverage) | 89.1% |
| [LAB all-pass (Anthropic harness)](/benchmarks/legalagentbenchallpass) | 23.58% |
| [LAB criterion-pass (Anthropic harness)](/benchmarks/legalagentbenchcriterionpass) | 93.74% |
| [LAB all-pass (Harvey held-out)](/benchmarks/legalagentbenchheldoutallpass) | 11.7% |
| [LAB criterion-pass (Harvey held-out)](/benchmarks/legalagentbenchheldoutcriterionpass) | 94.1% |
| [GDPval-AA](/benchmarks/gdpvalaa) | 1862 |
| [Toolathlon-Verified](/benchmarks/toolathlonverified) | 80.6% |
| [Toolathlon Verified Pass@3](/benchmarks/toolathlonverifiedpass3) | 87.0% |
| [Toolathlon Verified Pass³](/benchmarks/toolathlonverifiedpass3all) | 73.1% |
| [Toolathlon Verified avg. turns](/benchmarks/toolathlonverifiedavgturns) | 23.5 turns |
| [AutomationBench](/benchmarks/automationbench) | 26.0% |
| [AA Agentic Index](/benchmarks/aaagenticindex) | 59.2% |
| [GDPval-AA](/benchmarks/gdpvalaanormalized) | 66.2% |
| [AA Tau3 Banking](/benchmarks/aatau3banking) | 42.1% |
| [AA Briefcase](/benchmarks/aabriefcaseelo) | 1720 |
| [aaTerminalBench21](/benchmarks/aaterminalbench21) | 89.1% |
| [AA EnterpriseOps-Gym](/benchmarks/aaenterpriseopsgym) | 47.5% |
| [AA Harvey LAB](/benchmarks/aaharveylab) | 93.5% |
| [Terminal-Bench 2.1 (Vals)](/benchmarks/valsterminalbench21) | 84.6% |

## Coding Benchmarks

| Benchmark | Score |
|-----------|-------|
| [Bug Hunt Bench](/benchmarks/bug-hunt-bench) | 27 fixes |
| [SWE-bench Verified](/benchmarks/swe-bench-verified) | 96% |
| [SWE-bench Pro](/benchmarks/swe-bench-pro) | 79.2% |
| [SWE Multilingual](/benchmarks/swe-bench-multilingual) | 89.5% |
| [SWE Multimodal](/benchmarks/swe-bench-multimodal) | 59.4% |
| [deepSwe](/benchmarks/deepswe) | 68.8% |
| [FrontierCode 1.1 Main](/benchmarks/frontiercode) | 53.4% |
| [FrontierCode 1.1 Extended](/benchmarks/frontiercode11extended) | 63.6% |
| [FrontierSWE v2](/benchmarks/frontierswev2) | 52.0% |
| [ProgramBench (episode 1)](/benchmarks/programbenchepisode1) | 83.0% |
| [ProgramBench](/benchmarks/programbench) | 93.0% |
| [cursorBench32](/benchmarks/cursorbench32) | 70.0% |
| [VulcanBench v3](/benchmarks/vulcanbench) | 87.0% |
| [AA Coding Index](/benchmarks/aacodingindex) | 78.0% |
| [AA-SciCode](/benchmarks/aascicode) | 55.7% |
| [VulcanBench CII v1](/benchmarks/vulcanciiv1) | 96.4% |
| [LiveCodeBench (Vals)](/benchmarks/valslivecodebench) | 89.0% |
| [SWE-bench (Vals)](/benchmarks/valsswebench) | 97.0% |

## Multimodal & Grounded Benchmarks

| Benchmark | Score |
|-----------|-------|
| [Chartography (no tools)](/benchmarks/chartography) | 29.6% |
| [Chartography (tools)](/benchmarks/chartographywithtools) | 83.0% |
| [BenchCAD Vision2Code (no tools)](/benchmarks/benchcadvision2code) | 0.366 |
| [BenchCAD Vision2Code (tools)](/benchmarks/benchcadvision2codewithtools) | 0.821 |
| [GDP.pdf (no tools)](/benchmarks/gdppdf) | 83.4% |
| [GDP.pdf (tools)](/benchmarks/gdppdfwithtools) | 85.5% |
| [OfficeQA](/benchmarks/officeqa) | 78.1% |
| [OfficeQA Pro](/benchmarks/officeqapro) | 66.9% |
| [AA-MMMU-Pro](/benchmarks/aammmupro) | 84.7% |
| [Design Arena Website](/benchmarks/designarenawebsite) | 1324 |

## Reasoning Benchmarks

| Benchmark | Score |
|-----------|-------|
| [ARC-AGI-1](/benchmarks/arcagi1) | 97.50% |
| [ARC-AGI-2](/benchmarks/arc-agi-2) | 90.4% |
| [ARC-AGI-3](/benchmarks/arcagi3) | 30.2% |
| [AA-LCR](/benchmarks/lcr) | 75.7% |
| [CritPt](/benchmarks/critpt) | 29.1% |

## Knowledge Benchmarks

| Benchmark | Score |
|-----------|-------|
| [HLE](/benchmarks/hle) | 64.7% |
| [HLE w/o tools](/benchmarks/hlenotools) | 56.3% |
| [HLE-Verified](/benchmarks/hleverified) | 54.4% |
| [LABBench2](/benchmarks/labbench2) | 84.2% |
| [HealthBench (raw)](/benchmarks/healthbench) | 67.1% |
| [HealthBench (length-adjusted)](/benchmarks/healthbenchlengthadjusted) | 57.8% |
| [HealthBench Professional](/benchmarks/healthbenchprofessional) | 59.8% |
| [HealthBench Professional (raw)](/benchmarks/healthbenchprofessionalraw) | 73.4% |
| [BioMysteryBench (human-solvable)](/benchmarks/biomysterybenchhumansolvable) | 90.1% |
| [BioMysteryBench (human-difficult)](/benchmarks/biomysterybenchhumandifficult) | 49.4% |
| [SpatialBench Verified](/benchmarks/spatialbenchverified) | 72.5% |
| [SingleCellBench](/benchmarks/singlecellbench) | 60.6% |
| [ProteinGym Hard](/benchmarks/proteingymhard) | 47.7% |
| [Protein Design](/benchmarks/proteindesign) | 42.5% |
| [Organic chemistry V2](/benchmarks/organicchemistryv2) | 61.6% |
| [Protocols (troubleshooting)](/benchmarks/protocolstroubleshooting) | 61.1% |
| [Protocols (understanding)](/benchmarks/protocolsunderstanding) | 78.4% |
| [Artificial Analysis Intelligence Index](/benchmarks/artificialanalysis) | 63.0% |
| [AA-GPQA Diamond](/benchmarks/aagpqadiamond) | 93.2% |
| [AA-HLE](/benchmarks/aahle) | 54.9% |
| [AA-Omniscience Index](/benchmarks/aaomniscienceindex) | 37.1% |
| [AA-Omniscience Accuracy](/benchmarks/omniscienceaccuracy) | 60.9% |
| [AA-Omniscience Hallucination Rate](/benchmarks/omnisciencehallucinationrate) | 60.8% |
| [GPQA Diamond (Vals)](/benchmarks/valsgpqadiamond) | 93.4% |
| [MMLU-Pro (Vals)](/benchmarks/valsmmlupro) | 91.6% |

## Multilingual Benchmarks

| Benchmark | Score |
|-----------|-------|
| [GMMLU](/benchmarks/gmmlu) | 92.5% |
| [MILU](/benchmarks/milu) | 92.1% |
| [INCLUDE](/benchmarks/include) | 89.8% |

## Mathematics Benchmarks

| Benchmark | Score |
|-----------|-------|
| [IMO 2026](/benchmarks/imo2026) | 42/42 |
| [RiemannBench (no tools)](/benchmarks/riemannbench) | 60.0% |
| [RiemannBench (tools)](/benchmarks/riemannbenchwithtools) | 79.0% |
| [ArXivMath Jun. 2026 (no tools)](/benchmarks/arxivmathjune2026) | 90.8% |
| [ArXivMath Jun. 2026 (tools)](/benchmarks/arxivmathjune2026withtools) | 91.3% |

## Other Anthropic Models

- [Claude Fable 5.1](/models/claude-fable-5-1) - Score: 82.95
- [Claude Fable 5](/models/claude-fable) - Score: 80.9
- [Claude Opus 4.8](/models/claude-opus-4-8) - Score: 72.3
- [Claude Sonnet 5](/models/claude-sonnet-5) - Score: 70.76
- [Claude Opus 4.7](/models/claude-opus-4-7) - Score: 70.22
- [Claude Opus 4.7 (Adaptive)](/models/claude-opus-4-7-adaptive) - Score: 69.94
- [Claude Opus 4.6](/models/claude-opus-4-6) - Score: 69.84
- [Claude Sonnet 4.6](/models/claude-sonnet-4-6) - Score: 64.21
- [Claude Opus 4.6 (Adaptive)](/models/claude-opus-4-6-thinking) - Score: 63.58
- [Claude Opus 4.5](/models/claude-opus-4-5) - Score: 60.24
- [Claude Opus 4.5 Thinking](/models/claude-opus-4-5-thinking) - Score: 56.09
- [Claude Sonnet 4.5](/models/claude-sonnet-4-5) - Score: 53.74
- [Claude Haiku 4.5](/models/claude-haiku-4-5) - Score: 52.73
- [Claude 4.1 Opus](/models/claude-4-1-opus) - Score: 44.39
- [Claude 4 Sonnet](/models/claude-4-sonnet) - Score: 41.76
- [Claude 3 Opus](/models/claude-3-opus) - Score: 36.84
- [Claude 4.1 Opus Thinking](/models/claude-4-1-opus-thinking) - Score: 34.62
- [Claude 3.5 Sonnet](/models/claude-3-5-sonnet) - Score: 31.93
- [Claude 3 Haiku](/models/claude-3-haiku) - Score: 17.34
- [Claude Mythos 5](/models/claude-mythos-5) - Score: not computed
- [Claude Mythos 5.1](/models/claude-mythos-5-1) - Score: not computed
- [Claude Mythos Preview](/models/claude-mythos-preview) - Score: not computed
- [Claude Haiku 4.5 Thinking](/models/claude-haiku-4-5-thinking) - Score: not computed
- [Claude Sonnet 4.5 Thinking](/models/claude-sonnet-4-5-thinking) - Score: not computed
