# Claude Opus 4.8 Benchmark Scores & Performance

> Claude Opus 4.8 by Anthropic scores 69.12/100 overall, ranking #18 out of 889 AI models.

Canonical page: https://benchlm.ai/models/claude-opus-4-8

Last updated: October 10, 2026

## Model Details

| Property | Value |
|----------|-------|
| Creator | Anthropic |
| Source Type | Proprietary |
| Reasoning Type | Reasoning |
| Context Window | 1M |
| Overall Score | 69.12/100 |
| Overall Rank | #18 of 889 |

## Family & Coverage

- Family: Claude Opus 4.8
- Variant: base
- Benchmarks covered: 56 of 625
- Related earlier model: [Claude Opus 4.7 (Adaptive)](/models/claude-opus-4-7-adaptive)
- Coverage note: BenchLM currently has partial benchmark coverage for this model, so the overall score is conservative.

## Agentic Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [Terminal-Bench 3.0](/benchmarks/terminal-bench-3) | 21.1% | [Terminal-Bench 3.0 leaderboard](https://www.frontierbench.ai/) |
| [Terminal-Bench 2.1](/benchmarks/terminalbench21) | 74.6% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [BrowseComp](/benchmarks/browsecomp) | 84.3% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [DeepSearchQA](/benchmarks/deepsearchqa) | 93.1% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [OSWorld-Verified](/benchmarks/osworld-verified) | 83.4% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [Finance Agent v2](/benchmarks/financeagentv2) | 53.9% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [GDPval-AA](/benchmarks/gdpvalaa) | 1593 | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [MCP Atlas](/benchmarks/mcpatlas) | 82.2% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [Toolathlon](/benchmarks/toolathlon) | 59.9% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [Gert Labs](/benchmarks/gertlabs) | 72.97% | [Gert Labs rankings](https://gertlabs.com/rankings) |
| [τ²-bench results](/benchmarks/tau2-bench) | 94.4% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |
| [GDPval-AA](/benchmarks/gdpvalaanormalized) | 47.8% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |
| [ResearchClawBench](/benchmarks/researchclawbench) | 21.1% | [ResearchClawBench leaderboard](https://internscience.github.io/ResearchClawBench-Home/) |
| [OSWorld 2.0](/benchmarks/osworld2) | 20.6% | [OSWorld 2.0 paper](https://arxiv.org/abs/2606.29537) |
| [Terminal-Bench 2.1 (Vals)](/benchmarks/terminalbench21) | 71.9% | [Vals AI: Terminal-Bench 2.1 leaderboard](https://www.vals.ai/models/anthropic_claude-opus-4-8) |
| [AA Agentic Index](/benchmarks/aaagenticindex) | 42.6% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |

## Coding Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [SWE-bench Verified](/benchmarks/swe-bench-verified) | 88.6% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [SWE-bench Pro](/benchmarks/swe-bench-pro) | 69.2% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [SWE Multilingual](/benchmarks/swe-bench-multilingual) | 84.4% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [SWE Multimodal](/benchmarks/swe-bench-multimodal) | 38.4% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [Terminal-Bench 2.1](/benchmarks/terminalbench21) | 74.6% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [cursorBench31](/benchmarks/cursorbench31) | 58.4% | [Cursor evals: CursorBench 3.1](https://cursor.com/evals) |
| [CursorBench 3.2](/benchmarks/cursorbench32) | 62.3% | [Cursor evals: CursorBench 3.2](https://cursor.com/cursorbench) |
| [AA-SciCode](/benchmarks/aascicode) | 54.4% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |
| [FrontierCode 1.1 Main](/benchmarks/frontiercode) | 46.5% | [Cognition: FrontierCode 1.1](https://cognition.com/blog/frontier-code-1.1) |
| [LiveCodeBench (Vals)](/benchmarks/valslivecodebench) | 87.8% | [Vals AI: LiveCodeBench leaderboard](https://www.vals.ai/models/anthropic_claude-opus-4-8) |
| [SWE-bench (Vals)](/benchmarks/valsswebench) | 88.6% | [Vals AI: SWE-bench leaderboard](https://www.vals.ai/models/anthropic_claude-opus-4-8) |
| [AA Coding Index](/benchmarks/aacodingindex) | 74.3% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |
| [PostTrainBench v1.1](/benchmarks/posttrainbench-v1-1) | 32.9% | [PostTrainBench v1.1 public leaderboard](https://posttrainbench.com/?version=v1.1) |

## Multimodal & Grounded Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [OfficeQA Pro](/benchmarks/officeqapro) | 66.2% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [ScreenSpot Pro](/benchmarks/screenspot-pro) | 87.9% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [CharXiv](/benchmarks/charxiv) | 89.9% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [CharXiv w/o tools](/benchmarks/charxivnotools) | 80.5% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [Design Arena Website](/benchmarks/designarenawebsite) | 1262 | [OpenRouter model benchmarks](https://openrouter.ai/anthropic/claude-opus-4.8/benchmarks) |

## Reasoning Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [ARC-AGI-2](/benchmarks/arc-agi-2) | 72.1% | [ARC Prize official leaderboard data](https://arcprize.org/leaderboard) |
| [ARC-AGI-3](/benchmarks/arcagi3) | 1.5% | [ARC Prize official leaderboard data](https://arcprize.org/leaderboard) |
| [AA-LCR](/benchmarks/lcr) | 77.7% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |
| [CritPt](/benchmarks/critpt) | 20.9% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |
| [ARC-AGI-1](/benchmarks/arcagi1) | 92.50% | [ARC Prize: Claude Opus 4.8 (Max) verified results](https://arcprize.org/leaderboard) |

## Knowledge Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [GPQA](/benchmarks/gpqa) | 93.6% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [GPQA-D](/benchmarks/gpqa-diamond) | 93.6% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [HLE](/benchmarks/hle) | 57.9% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [HLE w/o tools](/benchmarks/hlenotools) | 49.8% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [Artificial Analysis Intelligence Index](/benchmarks/artificialanalysis) | 41.8% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |
| [AA-GPQA Diamond](/benchmarks/gpqa-diamond) | 92.0% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |
| [AA-HLE](/benchmarks/aahle) | 48.7% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |
| [AA-Omniscience Index](/benchmarks/aaomniscienceindex) | 28.8% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |
| [AA-Omniscience Accuracy](/benchmarks/omniscienceaccuracy) | 48.8% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |
| [AA-Omniscience Hallucination Rate](/benchmarks/omnisciencehallucinationrate) | 39.3% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |
| [GPQA Diamond (Vals)](/benchmarks/gpqa-diamond) | 92.4% | [Vals AI: GPQA Diamond leaderboard](https://www.vals.ai/models/anthropic_claude-opus-4-8) |
| [MMLU-Pro (Vals)](/benchmarks/mmlu-pro) | 89.6% | [Vals AI: MMLU Pro leaderboard](https://www.vals.ai/models/anthropic_claude-opus-4-8) |

## Instruction Following Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [AA-IFBench](/benchmarks/ifbench) | 62.2% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/claude-opus-4-8) |

## Multilingual Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [INCLUDE](/benchmarks/include) | 87.6% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |

## Mathematics Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [USAMO 2026](/benchmarks/usamo2026) | 96.7% | [Anthropic: Claude Opus 4.8 system card](https://cdn.sanity.io/files/4zrzovbb/website/c886650a2e96fc0925c805a1a7ca77314ccbf4a6.pdf) |
| [FrontierMath v2 (Tiers 1-3)](/benchmarks/frontiermathv2tiers13) | 47.241% | [Epoch AI FrontierMath v2 leaderboard](https://epoch.ai/benchmarks/frontiermath-tier-4-v2?view=graph&tab=leaderboard) |
| [FrontierMath v2 (Tier 4)](/benchmarks/frontiermathv2tier4) | 31.250% | [Epoch AI FrontierMath v2 leaderboard](https://epoch.ai/benchmarks/frontiermath-tier-4-v2?view=graph&tab=leaderboard) |

## Other Anthropic Models

- [Claude Opus 5.5](/models/claude-opus-5-5) - Score: 86.43
- [Claude Sonnet 5.5](/models/claude-sonnet-5-5) - Score: 83.92
- [Claude Fable 5.1](/models/claude-fable-5-1) - Score: 82.09
- [Claude Opus 5](/models/claude-opus-5) - Score: 79.44
- [Claude Fable 5](/models/claude-fable) - Score: 79.16
- [Claude Opus 4.7 (Adaptive)](/models/claude-opus-4-7-adaptive) - Score: 67.98
- [Claude Haiku 5.5](/models/claude-haiku-5-5) - Score: 66.78
- [Claude Sonnet 5](/models/claude-sonnet-5) - Score: 65.92
- [Claude Opus 4.7](/models/claude-opus-4-7) - Score: 64.23
- [Claude Opus 4.6](/models/claude-opus-4-6) - Score: 62.12
- [Claude Sonnet 4.6](/models/claude-sonnet-4-6) - Score: 55.41
- [Claude Opus 4.5 Thinking](/models/claude-opus-4-5-thinking) - Score: 54.19
- [Claude Opus 4.5](/models/claude-opus-4-5) - Score: 54.14
- [Claude Sonnet 4.5](/models/claude-sonnet-4-5) - Score: 47.8
- [Claude Haiku 4.5](/models/claude-haiku-4-5) - Score: 41.47
- [Claude 4.1 Opus](/models/claude-4-1-opus) - Score: 40.38
- [Claude 4.1 Opus Thinking](/models/claude-4-1-opus-thinking) - Score: 39.92
- [Claude 4 Sonnet](/models/claude-4-sonnet) - Score: 38.39
- [Claude 3 Opus](/models/claude-3-opus) - Score: 28.67
- [Claude 3.5 Sonnet](/models/claude-3-5-sonnet) - Score: 28.27
- [Claude 3 Haiku](/models/claude-3-haiku) - Score: 14.44
- [Claude Mythos 5](/models/claude-mythos-5) - Score: not computed
- [Claude Opus 4.6 (Adaptive)](/models/claude-opus-4-6-thinking) - Score: not computed
- [Claude Sonnet 4.5 Thinking](/models/claude-sonnet-4-5-thinking) - Score: not computed
- [Claude Mythos 5.1](/models/claude-mythos-5-1) - Score: not computed
- [Claude Mythos Preview](/models/claude-mythos-preview) - Score: not computed
- [Claude Haiku 4.5 Thinking](/models/claude-haiku-4-5-thinking) - Score: not computed
