# Benchmark Confidence and Provenance

> Server-readable mirror of https://benchlm.ai/benchmark-confidence. BenchLM tracks whether scores come from hand-entered public rows or inferred related rows, and audits exact-source verification separately.

## Confidence Distribution

| Confidence | Label | Ranked Models |
|------------|-------|---------------|
| 4 | Full | 26 |
| 3 | Good | 54 |
| 2 | Limited | 59 |
| 1 | Estimated | 72 |

## Highest Confidence Models

| Model | Creator | Score | Confidence | Sourced | Generated | Sourced Coverage |
|-------|---------|-------|------------|---------|-----------|------------------|
| [Qwen3.7 Plus](/models/qwen3-7-plus) | Alibaba | 56.54 | Full | 61 | 0 | 100% |
| [Qwen3.6 Plus](/models/qwen3-6-plus) | Alibaba | 55.19 | Full | 52 | 0 | 100% |
| [Claude Opus 4.5](/models/claude-opus-4-5) | Anthropic | 55.64 | Full | 49 | 0 | 100% |
| [Qwen3.6-35B-A3B](/models/qwen3-6-35b-a3b) | Alibaba | 44.71 | Full | 49 | 0 | 100% |
| [Kimi K2.5](/models/kimi-k2-5) | Moonshot AI | 53.65 | Full | 48 | 0 | 100% |
| [Qwen3.7 Max](/models/qwen3-7-max) | Alibaba | 63.44 | Full | 47 | 0 | 100% |
| [Qwen3.6-27B](/models/qwen3-6-27b) | Alibaba | 49.3 | Full | 47 | 0 | 100% |
| [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 70.8 | Full | 44 | 0 | 100% |
| [GPT-5.5](/models/gpt-5-5) | OpenAI | 69.38 | Full | 43 | 0 | 100% |
| [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 78.91 | Full | 42 | 0 | 100% |
| [GPT-5.4](/models/gpt-5-4) | OpenAI | 68.89 | Full | 40 | 0 | 100% |
| [GLM-5](/models/glm-5) | Z.AI | 55.04 | Full | 40 | 0 | 100% |
| [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 73.18 | Full | 39 | 0 | 100% |
| [Gemini 3.5 Flash](/models/gemini-3-5-flash) | Google | 63.93 | Full | 38 | 0 | 100% |
| [Claude Opus 4.6](/models/claude-opus-4-6) | Anthropic | 64.25 | Full | 37 | 0 | 100% |
| [Inkling](/models/inkling) | Thinking Machines Lab | 54.78 | Full | 34 | 0 | 100% |
| [Muse Spark](/models/muse-spark) | Meta | 61.23 | Full | 33 | 0 | 100% |
| [Inkling-Small](/models/inkling-small) | Thinking Machines Lab | 55.09 | Full | 32 | 0 | 100% |
| [Claude Sonnet 4.6](/models/claude-sonnet-4-6) | Anthropic | 56.86 | Full | 30 | 0 | 100% |
| [GPT-5.4 mini](/models/gpt-5-4-mini) | OpenAI | 55.63 | Full | 28 | 0 | 100% |
| [GPT-5.4 nano](/models/gpt-5-4-nano) | OpenAI | 51.44 | Full | 27 | 0 | 100% |
| [Muse Glimmer 30B](/models/muse-glimmer-30b) | Meta | 42.27 | Full | 26 | 0 | 100% |
| [Qwen3.5-122B-A10B](/models/qwen3-5-122b-a10b) | Alibaba | 41.65 | Full | 22 | 0 | 100% |
| [GPT-5.2](/models/gpt-5-2) | OpenAI | 61.92 | Full | 20 | 0 | 100% |
| [Qwen3.5-27B](/models/qwen3-5-27b) | Alibaba | 48.31 | Full | 20 | 0 | 100% |
| [Qwen3.5-35B-A3B](/models/qwen3-5-35b-a3b) | Alibaba | 47.63 | Full | 20 | 0 | 100% |
| [Claude Opus 5](/models/claude-opus-5) | Anthropic | 79.89 | Good | 80 | 0 | 100% |
| [Claude Opus 5.5](/models/claude-opus-5-5) | Anthropic | 87.68 | Good | 56 | 0 | 100% |
| [Qwen3.8 Max](/models/qwen3-8-max) | Alibaba | 72.1 | Good | 55 | 0 | 100% |
| [Kimi K3](/models/kimi-k3) | Moonshot AI | 72.12 | Good | 54 | 0 | 100% |
| [Claude Sonnet 5.5](/models/claude-sonnet-5-5) | Anthropic | 83.28 | Good | 53 | 0 | 100% |
| [Qwen3.8-27B](/models/qwen3-8-27b) | Alibaba | 57.56 | Good | 43 | 0 | 100% |
| [GPT-6 Astra](/models/gpt-6-astra) | OpenAI | 88.69 | Good | 38 | 0 | 100% |
| [DeepSeek V4 Pro 0813](/models/deepseek-v4-pro-0813) | DeepSeek | 64.95 | Good | 38 | 0 | 100% |
| [MiniMax M3](/models/minimax-m3) | MiniMax | 55.16 | Good | 36 | 0 | 100% |
| [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 66.2 | Good | 35 | 0 | 100% |
| [Kimi K2.6](/models/kimi-2-6) | Moonshot AI | 60.17 | Good | 34 | 0 | 100% |
| [Gemini 3.8 Flash](/models/gemini-3-8-flash) | Google | 73.92 | Good | 32 | 0 | 100% |
| [Gemini 3.7 Flash](/models/gemini-3-7-flash) | Google | 67.94 | Good | 32 | 0 | 100% |
| [Claude Sonnet 5](/models/claude-sonnet-5) | Anthropic | 67.35 | Good | 32 | 0 | 100% |

Canonical page: https://benchlm.ai/benchmark-confidence
