# Scale Labs SWE-Bench Pro V2 HARD (SWE-Bench Pro V2 HARD)

> A Scale Labs public leaderboard mirrored as display-only reference data. It does not affect BenchLM rankings.

Canonical page: https://benchlm.ai/benchmarks/scale-swe-bench-pro-public-v2-hard

- Category: [Coding](/coding)
- Last updated: September 23, 2026 snapshot

## About SWE-Bench Pro V2 HARD

- Year: 2026
- Tasks: 11 published rows
- Format: Published Scale leaderboard score
- Difficulty: External agent and model evaluation
- Paper: [Scale Labs leaderboard](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2)

BenchLM mirrors 11 published rows from the SWE-Bench Pro V2 HARD public table captured on September 23, 2026 snapshot.

SWE-Bench Pro V2 HARD is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (11 models)

| Rank | Model | Configuration | Creator | Score |
|------|-------|---------------|---------|-------|
| 1 | [Opus 5 (Claude Code) xhigh](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2) | SWE-Bench Pro V2 HARD | Unknown | 98.00% |
| 2 | [Fable 5.1 (Claude Code) high](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2) | SWE-Bench Pro V2 HARD | Unknown | 92.20% |
| 3 | [GPT-6 Astra (Codex) high](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2) | SWE-Bench Pro V2 HARD | Unknown | 90.20% |
| 4 | [Sonnet 5 (Claude Code) xhigh](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2) | SWE-Bench Pro V2 HARD | Anthropic | 88.20% |
| 5 | [Kimi-K3 (mini-swe-agent) max](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2) | SWE-Bench Pro V2 HARD | Moonshot AI | 88.20% |
| 6 | [GPT-5.6 Terra (Codex) xhigh](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2) | SWE-Bench Pro V2 HARD | OpenAI | 86.30% |
| 7 | [GLM-5.3 (mini-swe-agent) max](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2) | SWE-Bench Pro V2 HARD | Z.AI | 84.30% |
| 8 | [GPT-5.6 Sol (Codex) xhigh](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2) | SWE-Bench Pro V2 HARD | OpenAI | 82.40% |
| 9 | [Gemini 3.8 Flash (mini-swe-agent) high](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2) | SWE-Bench Pro V2 HARD | Google | 58.80% |
| 10 | [Inkling (mini-swe-agent) xhigh](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2) | SWE-Bench Pro V2 HARD | Thinkingmachines | 56.90% |
| 11 | [Haiku 4.5 (Claude Code) xhigh](https://labs.scale.com/leaderboard/swe_bench_pro_public_v2) | SWE-Bench Pro V2 HARD | Anthropic | 25.50% |

## FAQ

### What does SWE-Bench Pro V2 HARD measure?

A Scale Labs public leaderboard mirrored as display-only reference data. It does not affect BenchLM rankings.

### Which model leads the published SWE-Bench Pro V2 HARD snapshot?

Opus 5 (Claude Code) xhigh currently leads the published SWE-Bench Pro V2 HARD snapshot with a score of 98.00%.

### How many models are evaluated on SWE-Bench Pro V2 HARD?

The September 23, 2026 snapshot contains 11 AI models.

### Does SWE-Bench Pro V2 HARD affect BenchLM's overall score?

Not directly. SWE-Bench Pro V2 HARD is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.
