# Scale Labs PRBench Legal (PRBench Legal)

> A Scale Labs public leaderboard mirrored as display-only reference data. It does not affect BenchLM rankings.

Canonical page: https://benchlm.ai/benchmarks/scale-prbench-legal

- Category: [Knowledge](/knowledge)
- Last updated: September 29, 2026 snapshot

## About PRBench Legal

- Year: 2026
- Tasks: 39 published rows
- Format: Published Scale leaderboard score
- Difficulty: External agent and model evaluation
- Paper: [Scale Labs leaderboard](https://labs.scale.com/leaderboard/prbench-legal)

BenchLM mirrors 39 published rows from the PRBench Legal public table captured on September 29, 2026 snapshot.

PRBench Legal is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (39 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Muse Spark 1.3](/models/muse-spark-1-3) | Meta | 61.56% |
| 2 | [Muse Spark 1.1](/models/muse-spark-1-1) | Meta | 57.05% |
| 3 | [claude-fable 5\n\n](https://labs.scale.com/leaderboard/prbench-legal) | Anthropic | 52.56% |
| 4 | [Muse Spark](/models/muse-spark) | Meta | 52.29% |
| 5 | [claude-opus-4-6 (Non-Thinking)](https://labs.scale.com/leaderboard/prbench-legal) | Anthropic | 52.27% |
| 6 | [Fable 5.1 \n](https://labs.scale.com/leaderboard/prbench-legal) | Anthropic | 51.60% |
| 7 | [gpt-5.6-sol (max)\n](https://labs.scale.com/leaderboard/prbench-legal) | OpenAI | 50.50% |
| 8 | [gpt-5-pro](https://labs.scale.com/leaderboard/prbench-legal) | OpenAI | 49.89% |
| 9 | [o3-pro](/models/o3-pro) | OpenAI | 49.67% |
| 10 | [gpt-5.1-thinking](https://labs.scale.com/leaderboard/prbench-legal) | OpenAI | 49.33% |
| 11 | [gpt-5](https://labs.scale.com/leaderboard/prbench-legal) | OpenAI | 48.96% |
| 12 | [Gemini 3.8 Flash](/models/gemini-3-8-flash) | Google | 48.90% |
| 13 | [o3](/models/o3) | OpenAI | 48.57% |
| 14 | [GPT 6 Astra\n](https://labs.scale.com/leaderboard/prbench-legal) | OpenAI | 48.36% |
| 15 | [Grok 4.7 (xHigh)](https://labs.scale.com/leaderboard/prbench-legal) | xAI | 47.62% |
| 16 | [Claude Opus 5.5](/models/claude-opus-5-5) | Anthropic | 47.58% |
| 17 | [GPT-5.2 Pro](/models/gpt-5-2-pro) | OpenAI | 45.44% |
| 18 | [gpt-5.4 (High)](https://labs.scale.com/leaderboard/prbench-legal) | OpenAI | 44.35% |
| 19 | [Claude Opus 4.5 Thinking](/models/claude-opus-4-5-thinking) | Anthropic | 44.21% |
| 20 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | Google | 44.02% |
| 21 | [Kimi K2.5](/models/kimi-k2-5) | Moonshot AI | 43.83% |
| 22 | [GPT-6 Luna](/models/gpt-6-luna) | OpenAI | 42.85% |
| 23 | [Gemini 2.5 Pro](/models/gemini-2-5-pro) | Google | 41.43% |
| 24 | [Gemini 2.5 Flash](/models/gemini-2-5-flash) | Google | 41.02% |
| 25 | [kimi-k2-thinking](https://labs.scale.com/leaderboard/prbench-legal) | Moonshot AI | 40.90% |
| 26 | [Claude Sonnet 4.5](/models/claude-sonnet-4-5) | Anthropic | 40.84% |
| 27 | [gemini-3-pro-preview](https://labs.scale.com/leaderboard/prbench-legal) | Google | 40.60% |
| 28 | [GPT-OSS 120B](/models/gpt-oss-120b) | OpenAI | 40.21% |
| 29 | [mistral-medium-latest](https://labs.scale.com/leaderboard/prbench-legal) | Mistral | 39.55% |
| 30 | [GPT-6 Sol](/models/gpt-6-sol) | OpenAI | 38.60% |
| 31 | [qwen.qwen3-235b-a22b-2507-v1:0](https://labs.scale.com/leaderboard/prbench-legal) | Alibaba | 38.30% |
| 32 | [o4-mini](https://labs.scale.com/leaderboard/prbench-legal) | OpenAI | 38.11% |
| 33 | [deepseek-v3p1](https://labs.scale.com/leaderboard/prbench-legal) | Deepseek | 37.62% |
| 34 | [deepseek-r1-0528](https://labs.scale.com/leaderboard/prbench-legal) | Deepseek | 36.61% |
| 35 | [GPT-4.1](/models/gpt-4-1) | OpenAI | 36.48% |
| 36 | [kimi-k2-instruct](https://labs.scale.com/leaderboard/prbench-legal) | Moonshot AI | 36.38% |
| 37 | [claude-opus-4-1-20250805](https://labs.scale.com/leaderboard/prbench-legal) | Anthropic | 34.00% |
| 38 | [GPT-4.1 mini](/models/gpt-4-1-mini) | OpenAI | 30.38% |
| 39 | [llama4-maverick-instruct-basic](https://labs.scale.com/leaderboard/prbench-legal) | Meta | 24.84% |

## FAQ

### What does PRBench Legal measure?

A Scale Labs public leaderboard mirrored as display-only reference data. It does not affect BenchLM rankings.

### Which model leads the published PRBench Legal snapshot?

Muse Spark 1.3 currently leads the published PRBench Legal snapshot with a score of 61.56%.

### How many models are evaluated on PRBench Legal?

The September 29, 2026 snapshot contains 39 AI models.

### Does PRBench Legal affect BenchLM's overall score?

Not directly. PRBench Legal is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.
