# Artificial Analysis Terminal-Bench v4.0 (AA Terminal-Bench 4.0)

> An independently evaluated Terminal-Bench v4.0 result from Artificial Analysis, one of the ten components of its Intelligence Index v4.3.

Canonical page: https://benchlm.ai/benchmarks/aaterminalbench4

- Category: [Agentic](/agentic)
- Last updated: September 10, 2026

## About AA Terminal-Bench 4.0

- Year: 2026
- Tasks: Terminal-based agent tasks
- Format: Task success rate
- Difficulty: Agentic software engineering
- Paper: [Artificial Analysis Terminal-Bench v4.0 Benchmark Leaderboard](https://artificialanalysis.ai/evaluations/terminalbench-v4-0)

Stored separately from the benchmark-owned Terminal-Bench 4.0 lane because Artificial Analysis controls the agent harness and configuration. Display-only; not yet admitted as independent-run evidence.

AA Terminal-Bench 4.0 is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (15 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [GPT-6 Astra](/models/gpt-6-astra) | OpenAI | 59.1% |
| 2 | [Claude Fable 5.1](/models/claude-fable-5-1) | Anthropic | 52.0% |
| 3 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 49.0% |
| 4 | [Claude Fable 5](/models/claude-fable) | Anthropic | 42.4% |
| 5 | [GLM-5.3](/models/glm-5-3) | Z.AI | 41.9% |
| 6 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 39.9% |
| 7 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 35.4% |
| 8 | [Muse Spark 1.3](/models/muse-spark-1-3) | Meta | 33.3% |
| 9 | [GLM-5.3-Flash](/models/glm-5-3-flash) | Z.AI | 32.8% |
| 10 | [DeepSeek V4.1 Flash](/models/deepseek-v4-1-flash) | DeepSeek | 26.8% |
| 11 | [Grok 4.6](/models/grok-4-6) | xAI | 21.2% |
| 12 | [Gemini 3.8 Flash](/models/gemini-3-8-flash) | Google | 19.7% |
| 13 | [DeepSeek V4 Pro 0813](/models/deepseek-v4-pro-0813) | DeepSeek | 14.1% |
| 14 | [Kimi K3](/models/kimi-k3) | Moonshot AI | 12.6% |
| 15 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 11.6% |

## FAQ

### What does AA Terminal-Bench 4.0 measure?

An independently evaluated Terminal-Bench v4.0 result from Artificial Analysis, one of the ten components of its Intelligence Index v4.3.

### Which model scores highest on AA Terminal-Bench 4.0?

GPT-6 Astra by OpenAI currently leads with a score of 59.1% on AA Terminal-Bench 4.0.

### How many models are evaluated on AA Terminal-Bench 4.0?

15 AI models have been evaluated on AA Terminal-Bench 4.0 on BenchLM.

### Does AA Terminal-Bench 4.0 affect BenchLM's overall score?

Not directly. AA Terminal-Bench 4.0 is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Compare Top Models on AA Terminal-Bench 4.0

- [GPT-6 Astra vs Claude Fable 5.1](/compare/claude-fable-5-1-vs-gpt-6-astra)
- [Claude Fable 5.1 vs Claude Opus 5](/compare/claude-fable-5-1-vs-claude-opus-5)
- [Claude Opus 5 vs Claude Fable 5](/compare/claude-fable-vs-claude-opus-5)
- [Claude Fable 5 vs GLM-5.3](/compare/claude-fable-vs-glm-5-3)
