# Terminal-Bench 2.1 Extended — Mercor evaluation (Terminal-Bench 2.1 Extended (Mercor))

> Completing tasks in command-line environments. This table shows Mercor-run configurations for reference and is excluded from model rankings.

Canonical page: https://benchlm.ai/benchmarks/mercorterminalbench21extended

- Category: [Agentic](/agentic)
- Last updated: October 1, 2026 capture

Evaluation results published by [Mercor](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/). Published evaluation aggregates only; task contents and dataset license grants are not included.

We captured Mercor's Terminal-Bench 2.1 Extended results on October 1, 2026. The table preserves 35 published configurations, their source identifiers, reasoning settings, and disclosed pass@1 values. These are results from Mercor's evaluation setup; we did not rerun them.

The headline uses the 99 Mercor-built tasks. The paired original-set values refer to the separately listed 89-task public benchmark. Missing baselines remain unreported. We keep the extension and original set separate from their upstream benchmark-owner and provider-run tables.

The headline is the source page's selected Pass@1 metric. The task set, harness, tools, and grader belong to this Mercor run and may differ from another evaluator's results.

The row labels retain published error margins and sample counts when supplied. Missing margins and counts remain unreported; a sample count is not used to reconstruct a task denominator. Except where the dedicated source defines an interval, the confidence level is unreported. Equal displayed scores and overlapping margins do not establish statistical ties. Capture time does not establish individual evaluation dates.

The general methodology lists programmatic unit tests (all must pass) and a judge of None. Its run-count label is k = 3. Those notes describe the original public benchmark; extension-specific changes are not established by that reference.

- [Mercor Terminal-Bench 2.1 Extended results](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/)
- [Mercor APEX benchmark index](https://www.mercor.com/apex/)
- [Mercor methodology](https://www.mercor.com/apex/methodology/)
- [Paired Mercor original-set results](https://www.mercor.com/apex/oss-benchmarks/oss-terminal-bench-2-1-leaderboard/)
- [Source paper](https://arxiv.org/abs/2601.11868)
- [Upstream evaluation code](https://github.com/harbor-framework/terminal-bench-2)
- [Upstream dataset](https://github.com/harbor-framework/terminal-bench-2)

## About Terminal-Bench 2.1 Extended (Mercor)

- Tasks: 99 Mercor tasks; 89 tasks in the separately reported original set
- Format: Pass@1
- Difficulty: Source-specific evaluation
- Paper: [Terminal-Bench 2.1 Extended evaluation results](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/)

The selected headline is Pass@1. Source model identifiers, effort settings, published margins, and reported sample counts remain attached to the source configuration. Public-set results and Mercor task extensions occupy separate tables.

Terminal-Bench 2.1 Extended (Mercor) is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (35 configurations)

| Rank | Model | Configuration | Creator | Score |
|------|-------|---------------|---------|-------|
| 1 | [Opus 5.5](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±8.9 · Original set 83.5% ±7.7 · 297 reported samples | Anthropic | 47.50% |
| 2 | [GPT-6.1 Sol](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±8.9 · Original set 85.4% ±6.4 · 297 reported samples | OpenAI | 45.80% |
| 3 | [Grok 4.6](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · xhigh reasoning · Published margin ±8.8 · Original set 84.6% ±5.8 · 297 reported samples | xAI | 45.50% |
| 4 | [Sonnet 5.5](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±9.1 · Original set 87.3% ±6.4 · 297 reported samples | Anthropic | 45.50% |
| 5 | [GPT-6 Sol](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±8.8 · Original set 85.4% ±6.7 · 296 reported samples | OpenAI | 42.40% |
| 6 | [Gemini 3.6 Flash](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±8.1 · Original set 74.5% ±7.9 · 297 reported samples | Google | 40.10% |
| 7 | [GLM-5.3](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±8.1 · Original set 83.5% ±6.2 · 297 reported samples | Zhipu | 39.40% |
| 8 | [DeepSeek-V4.1-Flash](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±8.2 · Original set 86.5% ±5.1 · 297 reported samples | DeepSeek | 38.40% |
| 9 | [GPT-5.5](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · xhigh reasoning · Published margin ±8.4 · Original set 83.1% ±6.6 · 297 reported samples | OpenAI | 38.00% |
| 10 | [GPT-5.6 Sol](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · xhigh reasoning · Published margin ±9.1 · Original set 84.6% ±6.2 · 297 reported samples | OpenAI | 37.40% |
| 11 | [GPT-5.6 Terra](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±8.1 · Original set 80.9% ±6.9 · 297 reported samples | OpenAI | 36.40% |
| 12 | [GPT-5.6 Luna](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±7.9 · Original set 76.4% ±7.5 · 297 reported samples | OpenAI | 35.40% |
| 13 | [Gemini 3.1 Pro](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±8.1 · Original set 72.7% ±8.1 · 297 reported samples | Google | 35.00% |
| 14 | [Opus 5](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±8.6 · Original set 83.9% ±6.7 · 297 reported samples | Anthropic | 34.00% |
| 15 | [Grok 4.5](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±7.9 · Original set 79% ±7.5 · 297 reported samples | xAI | 33.30% |
| 16 | [GPT-6 Luna](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±8.2 · Original set 77.9% ±7.5 · 297 reported samples | OpenAI | 33.30% |
| 17 | [GPT-5.4](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · xhigh reasoning · Published margin ±7.7 · Original set 77.2% ±7.9 · 297 reported samples | OpenAI | 31.30% |
| 18 | [Kimi K3](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±7.1 · Original set 82% ±6.4 · 297 reported samples | Kimi | 31.00% |
| 19 | [DeepSeek-V4-Flash](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±7.6 · Original set 72.3% ±8.4 · 297 reported samples | DeepSeek | 30.00% |
| 20 | [Opus 4.8](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±7.6 · Original set 82% ±6.7 · 297 reported samples | Anthropic | 29.30% |
| 21 | [Sonnet 5](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±7.7 · Original set 82.4% ±7.1 · 294 reported samples | Anthropic | 28.90% |
| 22 | [Gemini 3.5 Flash](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±7.6 · Original set 73.8% ±7.5 · 297 reported samples | Google | 28.60% |
| 23 | [Opus 4.7](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±7.6 · Original set 76.4% ±7.9 · 297 reported samples | Anthropic | 27.60% |
| 24 | [Kimi K2.7 Code](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±6.6 · Original set 68.9% ±8.1 · 297 reported samples | Kimi | 23.60% |
| 25 | [MiniMax-M3](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±6.2 · Original set 61.4% ±8.4 · 297 reported samples | MiniMax | 22.20% |
| 26 | [DeepSeek-V4-Pro](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±6.2 · Original set 66.7% ±8.4 · 297 reported samples | DeepSeek | 21.20% |
| 27 | [Fable 5.1](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±7.2 · Original set 72.7% ±8.6 · 297 reported samples | Anthropic | 19.50% |
| 28 | [Qwen3.5](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · Published margin ±6.2 · Original set 53.9% ±9.7 · 297 reported samples | Alibaba | 17.80% |
| 29 | [Sonnet 4.6](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±6.2 · Original set 62.9% ±9.4 · 297 reported samples | Anthropic | 17.50% |
| 30 | [Fable 5](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · max reasoning · Published margin ±6.7 · Original set not reported · 297 reported samples | Anthropic | 16.80% |
| 31 | [DeepSeek-V3.2](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · Published margin ±5.1 · Original set 44.6% ±9 · 297 reported samples | DeepSeek | 15.20% |
| 32 | [Nemotron 3 Ultra](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±5.1 · Original set 49.8% ±9 · 297 reported samples | NVIDIA | 11.80% |
| 33 | [Grok 4.7](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · xhigh reasoning · Published margin ±4.2 · Original set not reported · 297 reported samples | xAI | 11.80% |
| 34 | [Kimi K2 (Thinking)](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±4.5 · Original set 39% ±8.6 · 297 reported samples | Kimi | 11.10% |
| 35 | [MiniMax-M2.7](https://www.mercor.com/apex/mercor-extended/ots-held-out-terminal-bench-2-1-leaderboard/) | Mercor extended-set run · high reasoning · Published margin ±4.7 · Original set 54.3% ±9 · 297 reported samples | MiniMax | 10.10% |

## FAQ

### What does Terminal-Bench 2.1 Extended (Mercor) measure?

Completing tasks in command-line environments. This table shows Mercor-run configurations for reference and is excluded from model rankings.

### Which model leads the published Terminal-Bench 2.1 Extended (Mercor) snapshot?

Opus 5.5 currently leads the published Terminal-Bench 2.1 Extended (Mercor) snapshot with a score of 47.50%.

### How many models are evaluated on Terminal-Bench 2.1 Extended (Mercor)?

The October 1, 2026 capture contains 35 source configurations.

### Does Terminal-Bench 2.1 Extended (Mercor) affect BenchLM's overall score?

Not directly. Terminal-Bench 2.1 Extended (Mercor) is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.
