# ReactBench v1 (ReactBench)

> A coding-agent benchmark for realistic React work, with rubrics that check production concerns such as performance, accessibility, correctness, and code quality.

Canonical page: https://benchlm.ai/benchmarks/reactbench

- Category: [Coding](/coding)
- Last updated: September 15, 2026 snapshot

## About ReactBench

- Year: 2026
- Tasks: 51 production React tasks
- Format: Pass@1 weighted rubric score
- Difficulty: Production frontend engineering
- Paper: [ReactBench](https://www.reactbench.com/)

ReactBench uses 51 tasks drawn from real React repositories. Its weighted rubric score assigns zero to solutions that miss a blocking criterion. We mirror each published reasoning-effort variant and its average rollout cost, but keep the results out of weighted coding scores because the agent setup and effort level are part of the row.

ReactBench is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (54 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 46.7% |
| 2 | [Fable 5.1 · Max](https://www.reactbench.com/data) | Anthropic | 45.6% |
| 3 | [Fable 5.1 · XHigh](https://www.reactbench.com/data) | Anthropic | 44.1% |
| 4 | [Claude Fable 5](/models/claude-fable) | Anthropic | 43.6% |
| 5 | [Claude Fable 5](/models/claude-fable) | Anthropic | 42.1% |
| 6 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 42.1% |
| 7 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 42.1% |
| 8 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 42.1% |
| 9 | [Fable 5.1 · High](https://www.reactbench.com/data) | Anthropic | 40.5% |
| 10 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 40.5% |
| 11 | [Claude Fable 5](/models/claude-fable) | Anthropic | 39.0% |
| 12 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 37.4% |
| 13 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 37.4% |
| 14 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 36.9% |
| 15 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 36.4% |
| 16 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 34.9% |
| 17 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 33.8% |
| 18 | [Qwen 3.8 Max · XHigh](https://www.reactbench.com/data) | Alibaba | 32.3% |
| 19 | [Grok 4.6](/models/grok-4-6) | xAI | 32.3% |
| 20 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 32.3% |
| 21 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 32.3% |
| 22 | [Claude Fable 5](/models/claude-fable) | Anthropic | 31.8% |
| 23 | [GLM-5.3-Flash](/models/glm-5-3-flash) | Z.AI | 31.3% |
| 24 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 30.8% |
| 25 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 30.8% |
| 26 | [Grok 4.6](/models/grok-4-6) | xAI | 30.8% |
| 27 | [Gemini 3.8 Flash](/models/gemini-3-8-flash) | Google | 30.8% |
| 28 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 30.8% |
| 29 | [Kimi K3](/models/kimi-k3) | Moonshot AI | 30.8% |
| 30 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 30.3% |
| 31 | [Claude Sonnet 5](/models/claude-sonnet-5) | Anthropic | 29.7% |
| 32 | [DeepSeek V4 Pro 0813](/models/deepseek-v4-pro-0813) | DeepSeek | 29.7% |
| 33 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 29.7% |
| 34 | [Claude Sonnet 5](/models/claude-sonnet-5) | Anthropic | 29.2% |
| 35 | [Fable 5.1 · Medium](https://www.reactbench.com/data) | Anthropic | 28.7% |
| 36 | [Claude Sonnet 5](/models/claude-sonnet-5) | Anthropic | 28.2% |
| 37 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 28.2% |
| 38 | [GLM-5.3](/models/glm-5-3) | Z.AI | 27.7% |
| 39 | [Fable 5.1 · Low](https://www.reactbench.com/data) | Anthropic | 27.2% |
| 40 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 26.7% |
| 41 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 26.2% |
| 42 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 25.6% |
| 43 | [Grok 4.6](/models/grok-4-6) | xAI | 25.6% |
| 44 | [Grok 4.6](/models/grok-4-6) | xAI | 25.6% |
| 45 | [GLM-5.2](/models/glm-5-2) | Z.AI | 24.1% |
| 46 | [Claude Sonnet 5](/models/claude-sonnet-5) | Anthropic | 22.6% |
| 47 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 21.0% |
| 48 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 19.5% |
| 49 | [Muse Spark 1.2](/models/muse-spark-1-2) | Meta | 19.5% |
| 50 | [DeepSeek V4 Flash 0731](/models/deepseek-v4-flash-0731) | DeepSeek | 18.5% |
| 51 | [Claude Sonnet 5](/models/claude-sonnet-5) | Anthropic | 16.9% |
| 52 | [Composer 2.5](/models/composer-2-5) | Cursor | 13.3% |
| 53 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 8.7% |
| 54 | [Inkling-Small](/models/inkling-small) | Thinking Machines Lab | 6.7% |

## FAQ

### What does ReactBench measure?

A coding-agent benchmark for realistic React work, with rubrics that check production concerns such as performance, accessibility, correctness, and code quality.

### Which model leads the published ReactBench snapshot?

GPT-5.6 Sol currently leads the published ReactBench snapshot with a score of 46.7%.

### How many models are evaluated on ReactBench?

The September 15, 2026 snapshot contains 54 AI models.

### Does ReactBench affect BenchLM's overall score?

Not directly. ReactBench is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.
