# JobBench

> An occupational agent benchmark for professional workflows that workers say they most want delegated to AI.

Canonical page: https://benchlm.ai/benchmarks/jobbench

- Category: [Agentic](/agentic)
- Last updated: September 10, 2026

## About JobBench

- Year: 2026
- Tasks: 130 tasks across 35 occupations
- Format: Agentic workplace deliverables
- Difficulty: Professional multi-source workflows
- Paper: [JobBench: Aligning Agent Work With Human Will](https://arxiv.org/abs/2605.26329)

JobBench evaluates agents on source-grounded workplace tasks across 35 occupations, using heterogeneous reference files and fact-anchored chained rubrics. BenchLM tracks the main-set score as a display-only professional-agent benchmark.

JobBench is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (26 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Muse Spark 1.3](/models/muse-spark-1-3) | Meta | 64.9% |
| 2 | [Hy4 preview](/models/hy4-preview) | Tencent | 61.7% |
| 3 | [Qwen3.8-Flash-Next](/models/qwen3-8-flash-next) | Alibaba | 55.7% |
| 4 | [Muse Spark 1.1](/models/muse-spark-1-1) | Meta | 54.7% |
| 5 | [Qwen3.8 Max](/models/qwen3-8-max) | Alibaba | 53.4% |
| 6 | [Kimi K3](/models/kimi-k3) | Moonshot AI | 52.9% |
| 7 | [Claude Opus 4.7 (Adaptive)](/models/claude-opus-4-7-adaptive) | Anthropic | 45.9% |
| 8 | [GPT-5.5](/models/gpt-5-5) | OpenAI | 42.7% |
| 9 | [GPT-5.4](/models/gpt-5-4) | OpenAI | 38.9% |
| 10 | [Claude Sonnet 4.6](/models/claude-sonnet-4-6) | Anthropic | 36.9% |
| 11 | [Claude Opus 4.6](/models/claude-opus-4-6) | Anthropic | 36.7% |
| 12 | [GPT-5.2](/models/gpt-5-2) | OpenAI | 34.3% |
| 13 | [GPT-5.3 Codex](/models/gpt-5-3-codex) | OpenAI | 33.7% |
| 14 | [Qwen3.8-27B](/models/qwen3-8-27b) | Alibaba | 33.4% |
| 15 | [Claude Opus 4.5](/models/claude-opus-4-5) | Anthropic | 32.3% |
| 16 | [Claude Sonnet 4.5](/models/claude-sonnet-4-5) | Anthropic | 27.7% |
| 17 | [GPT-5.1-Codex](/models/gpt-5-1-codex) | OpenAI | 26.2% |
| 18 | [GPT-5.2-Codex](/models/gpt-5-2-codex) | OpenAI | 26.0% |
| 19 | [Claude 4.1 Opus](/models/claude-4-1-opus) | Anthropic | 21.9% |
| 20 | [Qwen3.5 Plus](/models/qwen3-5-plus) | Alibaba | 18.5% |
| 21 | [Claude 4 Sonnet](/models/claude-4-sonnet) | Anthropic | 18.4% |
| 22 | [Claude Haiku 4.5](/models/claude-haiku-4-5) | Anthropic | 16.0% |
| 23 | [Gemini 3 Pro](/models/gemini-3-pro) | Google | 11.4% |
| 24 | [Gemini 3 Flash](/models/gemini-3-flash) | Google | 11.4% |
| 25 | [Kimi K2.5](/models/kimi-k2-5) | Moonshot AI | 8.7% |
| 26 | [GPT-5 (high)](/models/gpt-5-high) | OpenAI | 8.5% |

## FAQ

### What does JobBench measure?

An occupational agent benchmark for professional workflows that workers say they most want delegated to AI.

### Which model scores highest on JobBench?

Muse Spark 1.3 by Meta currently leads with a score of 64.9% on JobBench.

### How many models are evaluated on JobBench?

26 AI models have been evaluated on JobBench on BenchLM.

### Does JobBench affect BenchLM's overall score?

Not directly. JobBench is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Compare Top Models on JobBench

- [Muse Spark 1.3 vs Hy4 preview](/compare/hy4-preview-vs-muse-spark-1-3)
- [Hy4 preview vs Qwen3.8-Flash-Next](/compare/hy4-preview-vs-qwen3-8-flash-next)
- [Qwen3.8-Flash-Next vs Muse Spark 1.1](/compare/muse-spark-1-1-vs-qwen3-8-flash-next)
- [Muse Spark 1.1 vs Qwen3.8 Max](/compare/muse-spark-1-1-vs-qwen3-8-max)
