# Artificial Analysis Briefcase (AA Briefcase)

> An independently evaluated professional-work benchmark reported as Elo.

Canonical page: https://benchlm.ai/benchmarks/aabriefcaseelo

- Category: [Agentic](/agentic)
- Last updated: September 27, 2026

## About AA Briefcase

- Year: 2026
- Tasks: Professional knowledge-work tasks
- Format: Elo
- Difficulty: Professional work
- Paper: [Artificial Analysis Briefcase Benchmark Leaderboard](https://artificialanalysis.ai/evaluations/aa-briefcase)

Stored as a display-only Elo rating.

AA Briefcase is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (14 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Claude Opus 5.5](/models/claude-opus-5-5) | Anthropic | 1822 |
| 2 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 1720 |
| 3 | [Claude Fable 5.1](/models/claude-fable-5-1) | Anthropic | 1678 |
| 4 | [Grok 4.7](/models/grok-4-7) | xAI | 1657 |
| 5 | [Muse Spark 1.3](/models/muse-spark-1-3) | Meta | 1597 |
| 6 | [GPT-6 Astra](/models/gpt-6-astra) | OpenAI | 1569 |
| 7 | [Grok 4.6](/models/grok-4-6) | xAI | 1546 |
| 8 | [GLM-5.3](/models/glm-5-3) | Z.AI | 1525 |
| 9 | [MiMo-V2.6-Pro](/models/mimo-v2-6-pro) | Xiaomi | 1522 |
| 10 | [Kimi K3](/models/kimi-k3) | Moonshot AI | 1510 |
| 11 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 1487 |
| 12 | [GPT-6 Sol](/models/gpt-6-sol) | OpenAI | 1483 |
| 13 | [GLM-5.3-Flash](/models/glm-5-3-flash) | Z.AI | 1459 |
| 14 | [Step 5 Preview](/models/step-5-preview) | StepFun | 1432 |

## FAQ

### What does AA Briefcase measure?

An independently evaluated professional-work benchmark reported as Elo.

### Which model scores highest on AA Briefcase?

Claude Opus 5.5 by Anthropic currently leads with a score of 1822 on AA Briefcase.

### How many models are evaluated on AA Briefcase?

14 AI models have been evaluated on AA Briefcase on BenchLM.

### Does AA Briefcase affect BenchLM's overall score?

Not directly. AA Briefcase is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Compare Top Models on AA Briefcase

- [Claude Opus 5.5 vs Claude Opus 5](/compare/claude-opus-5-vs-claude-opus-5-5)
- [Claude Opus 5 vs Claude Fable 5.1](/compare/claude-fable-5-1-vs-claude-opus-5)
- [Claude Fable 5.1 vs Grok 4.7](/compare/claude-fable-5-1-vs-grok-4-7)
- [Grok 4.7 vs Muse Spark 1.3](/compare/grok-4-7-vs-muse-spark-1-3)
