# SWE-bench Verified Extended — Mercor evaluation (SWE-bench Verified Extended (Mercor))

> Editing repositories to resolve verified GitHub issues. This table shows Mercor-run configurations for reference and is excluded from model rankings.

Canonical page: https://benchlm.ai/benchmarks/mercorsweverifiedextended

- Category: [Coding](/coding)
- Last updated: October 1, 2026 capture

Evaluation results published by [Mercor](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/). Published evaluation aggregates only; task contents and dataset license grants are not included.

We captured Mercor's SWE-bench Verified Extended results on October 1, 2026. The table preserves 33 published configurations, their source identifiers, reasoning settings, and disclosed pass@1 values. These are results from Mercor's evaluation setup; we did not rerun them.

The headline uses the 50 Mercor-built tasks. The paired original-set values refer to the separately listed 500-task public benchmark. Missing baselines remain unreported. We keep the extension and original set separate from their upstream benchmark-owner and provider-run tables.

The headline is the source page's selected Pass@1 metric. The task set, harness, tools, and grader belong to this Mercor run and may differ from another evaluator's results.

The row labels retain published error margins and sample counts when supplied. Missing margins and counts remain unreported; a sample count is not used to reconstruct a task denominator. Except where the dedicated source defines an interval, the confidence level is unreported. Equal displayed scores and overlapping margins do not establish statistical ties. Capture time does not establish individual evaluation dates.

The general methodology lists programmatic fail-to-pass and pass-to-pass unit tests (all must pass) and a judge of None. Its run-count label is k = 3. Those notes describe the original public benchmark; extension-specific changes are not established by that reference.

- [Mercor SWE-bench Verified Extended results](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/)
- [Mercor APEX benchmark index](https://www.mercor.com/apex/)
- [Mercor methodology](https://www.mercor.com/apex/methodology/)
- [Paired Mercor original-set results](https://www.mercor.com/apex/oss-benchmarks/oss-swe-bench-verified-leaderboard/)
- [Source paper](https://arxiv.org/abs/2310.06770)
- [Upstream evaluation code](https://github.com/SWE-bench/SWE-bench)
- [Upstream dataset](https://huggingface.co/datasets/princeton-nlp/SWE-bench_Verified)

## About SWE-bench Verified Extended (Mercor)

- Tasks: 50 Mercor tasks; 500 tasks in the separately reported original set
- Format: Pass@1
- Difficulty: Source-specific evaluation
- Paper: [SWE-bench Verified Extended evaluation results](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/)

The selected headline is Pass@1. Source model identifiers, effort settings, published margins, and reported sample counts remain attached to the source configuration. Public-set results and Mercor task extensions occupy separate tables.

SWE-bench Verified Extended (Mercor) is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (33 configurations)

| Rank | Model | Configuration | Creator | Score |
|------|-------|---------------|---------|-------|
| 1 | [DeepSeek-V4.1-Flash](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±10.3 · Original set 82.9% ±3 · 150 reported samples | DeepSeek | 82.70% |
| 2 | [Opus 5](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±9.3 · Original set 93.5% ±2 · 150 reported samples | Anthropic | 82.00% |
| 3 | [Fable 5](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±9.7 · Original set 95.9% ±1.5 · 150 reported samples | Anthropic | 78.70% |
| 4 | [GPT-5.6 Terra](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±11 · Original set 77.8% ±3.5 · 150 reported samples | OpenAI | 78.70% |
| 5 | [GPT-5.6 Luna](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±11.7 · Original set 76.2% ±3.6 · 150 reported samples | OpenAI | 74.70% |
| 6 | [Grok 4.5](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±10.3 · Original set 81.7% ±3.2 · 150 reported samples | xAI | 70.70% |
| 7 | [GLM-5.3](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±10 · Original set 81.7% ±3.2 · 150 reported samples | Zhipu | 68.00% |
| 8 | [Sonnet 5](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±11 · Original set 82.8% ±3 · 150 reported samples | Anthropic | 67.30% |
| 9 | [Opus 5.5](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±11.7 · Original set 98.2% ±1.1 · 150 reported samples | Anthropic | 66.00% |
| 10 | [Opus 4.8](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±11 · Original set 88.5% ±2.6 · 150 reported samples | Anthropic | 63.30% |
| 11 | [GPT-5.6 Sol (Pro)](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±11.3 · Original set 72.8% ±3.4 · 150 reported samples | OpenAI | 63.30% |
| 12 | [Fable 5.1](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±11.7 · Original set 96.6% ±1.5 · 150 reported samples | Anthropic | 61.30% |
| 13 | [Qwen3.8-Max](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · xhigh reasoning · Published margin ±10.7 · Original set not reported · 150 reported samples | Alibaba | 58.70% |
| 14 | [Opus 4.7](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±11.3 · Original set 83.1% ±3 · 150 reported samples | Anthropic | 58.00% |
| 15 | [Fable 5.1](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±12 · Original set 92.1% ±2.2 · 150 reported samples | Anthropic | 57.30% |
| 16 | [Sonnet 5.5](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±12.7 · Original set 96.7% ±1.5 · 150 reported samples | Anthropic | 57.30% |
| 17 | [Gemini 3.8 Flash](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±12 · Original set 80.6% ±3.4 · 150 reported samples | Google | 54.00% |
| 18 | [GLM-5.2](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±12 · Original set 78.5% ±3.3 · 150 reported samples | Zhipu | 47.30% |
| 19 | [GPT-6.1 Sol](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±13.3 · Original set 87.3% ±2.8 · 150 reported samples | OpenAI | 45.30% |
| 20 | [GPT-5.4](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · xhigh reasoning · Published margin ±12 · Original set 78.1% ±3.4 · 150 reported samples | OpenAI | 40.00% |
| 21 | [GPT-5.5](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · xhigh reasoning · Published margin ±13 · Original set 78.8% ±3.3 · 150 reported samples | OpenAI | 39.30% |
| 22 | [GPT-6 Luna](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±13 · Original set 76.1% ±3.5 · 150 reported samples | OpenAI | 39.30% |
| 23 | [GPT-6 Sol](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±12 · Original set 80.3% ±3.3 · 150 reported samples | OpenAI | 39.30% |
| 24 | [Gemini 3.6 Flash](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±11.7 · Original set 81.1% ±3.3 · 150 reported samples | Google | 33.30% |
| 25 | [Gemini 3.7 Flash](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±10.3 · Original set 81% ±3.3 · 150 reported samples | Google | 30.00% |
| 26 | [MiniMax-M3](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±9.7 · Original set 75.5% ±3.5 · 150 reported samples | MiniMax | 28.70% |
| 27 | [Sonnet 4.6](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±10.7 · Original set 79.1% ±3.4 · 150 reported samples | Anthropic | 27.30% |
| 28 | [Kimi K2.7 Code](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±10 · Original set 78.2% ±3.4 · 150 reported samples | Kimi | 26.70% |
| 29 | [Gemini 3.5 Flash](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±9 · Original set 78.5% ±3.5 · 150 reported samples | Google | 22.70% |
| 30 | [DeepSeek-V4-Pro](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±9.3 · Original set 75.4% ±3.5 · 150 reported samples | DeepSeek | 22.00% |
| 31 | [Gemini 3.1 Pro](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±9.7 · Original set 78.4% ±3.3 · 150 reported samples | Google | 21.30% |
| 32 | [DeepSeek-V3.2](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · Published margin ±5 · Original set 66% ±3.7 · 150 reported samples | DeepSeek | 10.00% |
| 33 | [MiniMax-M2.7](https://www.mercor.com/apex/mercor-extended/ots-held-out-swe-bench-verified-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±5 · Original set 75.3% ±3.5 · 150 reported samples | MiniMax | 6.70% |

## FAQ

### What does SWE-bench Verified Extended (Mercor) measure?

Editing repositories to resolve verified GitHub issues. This table shows Mercor-run configurations for reference and is excluded from model rankings.

### Which model leads the published SWE-bench Verified Extended (Mercor) snapshot?

DeepSeek-V4.1-Flash currently leads the published SWE-bench Verified Extended (Mercor) snapshot with a score of 82.70%.

### How many models are evaluated on SWE-bench Verified Extended (Mercor)?

The October 1, 2026 capture contains 33 source configurations.

### Does SWE-bench Verified Extended (Mercor) affect BenchLM's overall score?

Not directly. SWE-bench Verified Extended (Mercor) is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.
