Skip to main content
BenchLM

Benchmark Confidence & Contamination Flags

26 of 211 ranked models (12%) meet BenchLM's high-confidence bar of seven or more categories and twenty or more sourced benchmark rows. 72 ranked models carry an estimated score with limited sourced coverage. Generated rows never count toward any public ranking.

Evidence ledger verified

The confidence indicator (1-4 dots) shows how much sourced benchmark coverage supports each score, while the table separates sourced, provisional, and generated evidence.

High
7+ categories, 20+ non-generated benchmarks
Good
5+ categories, 12+ non-generated benchmarks
Moderate
3+ categories, 8+ non-generated benchmarks
Low / Estimated
Limited sourced data, score is estimated

Confidence Distribution (Ranked Models)

26

High (12%)

54

Good (26%)

59

Moderate (28%)

72

Low / Estimated (34%)

How scores work

Verified, provisional, and generated

Each benchmark value is tagged as manual (a hand-entered public row) or generated (inferred from related models). Generated rows are excluded from all public ranking logic. Manual rows are now split again into sourced rows for the verified leaderboard and source-unverified rows that can still appear in provisional mode.

Ranking Eligibility

A model must have at least 8 qualifying benchmarks across 2+ categories to rank in a lane. The provisional leaderboard uses rankable non-generated rows; the verified leaderboard uses sourced rows only. Models below the threshold are shown as tracked but unranked.

Category Eligibility

For category leaderboards, a model needs qualifying scores on at least half of the weighted benchmarks in that category. BenchLM computes this separately for provisional and verified ranking so sparse exact-source coverage cannot silently borrow strength from provisional rows.

Display-only benchmarks

Some benchmarks (MMLU, BBH, HumanEval, older AIME/HMMT variants) are shown for context but don't affect scoring. These are either saturated (top models all score 97%+) or have been superseded by harder versions.

211 models match these filters.

Model / evidenceConfidence / score
Qwen3.7 PlusAlibaba61 sourced · 61 rankable · 0 generated
●●●●High56.54provisional score
Qwen3.6 PlusAlibaba52 sourced · 52 rankable · 0 generated
●●●●High55.19provisional score
Claude Opus 4.5Anthropic49 sourced · 49 rankable · 0 generated
●●●●High55.64provisional score
Qwen3.6-35B-A3BAlibaba49 sourced · 49 rankable · 0 generated
●●●●High44.71provisional score
Kimi K2.5Moonshot AI48 sourced · 48 rankable · 0 generated
●●●●High53.65provisional score
Qwen3.7 MaxAlibaba47 sourced · 47 rankable · 0 generated
●●●●High63.44provisional score
Qwen3.6-27BAlibaba47 sourced · 47 rankable · 0 generated
●●●●High49.3provisional score
Claude Opus 4.8Anthropic44 sourced · 44 rankable · 0 generated
●●●●High70.8provisional score
GPT-5.5OpenAI43 sourced · 43 rankable · 0 generated
●●●●High69.38provisional score
GPT-5.6 SolOpenAI42 sourced · 42 rankable · 0 generated
●●●●High78.91provisional score
GPT-5.4OpenAI40 sourced · 40 rankable · 0 generated
●●●●High68.89provisional score
GLM-5Z.AI40 sourced · 40 rankable · 0 generated
●●●●High55.04provisional score
GPT-5.6 TerraOpenAI39 sourced · 39 rankable · 0 generated
●●●●High73.18provisional score
Gemini 3.5 FlashGoogle38 sourced · 38 rankable · 0 generated
●●●●High63.93provisional score
Claude Opus 4.6Anthropic37 sourced · 37 rankable · 0 generated
●●●●High64.25provisional score
InklingThinking Machines Lab34 sourced · 34 rankable · 0 generated
●●●●High54.78provisional score
Muse SparkMeta33 sourced · 33 rankable · 0 generated
●●●●High61.23provisional score
Inkling-SmallThinking Machines Lab32 sourced · 32 rankable · 0 generated
●●●●High55.09provisional score
Claude Sonnet 4.6Anthropic30 sourced · 30 rankable · 0 generated
●●●●High56.86provisional score
GPT-5.4 miniOpenAI28 sourced · 28 rankable · 0 generated
●●●●High55.63provisional score
GPT-5.4 nanoOpenAI27 sourced · 27 rankable · 0 generated
●●●●High51.44provisional score
Muse Glimmer 30BMeta26 sourced · 20 rankable · 0 generated
●●●●High42.27provisional score
Qwen3.5-122B-A10BAlibaba22 sourced · 22 rankable · 0 generated
●●●●High41.65provisional score
GPT-5.2OpenAI20 sourced · 20 rankable · 0 generated
●●●●High61.92provisional score
Qwen3.5-27BAlibaba20 sourced · 20 rankable · 0 generated
●●●●High48.31provisional score
Qwen3.5-35B-A3BAlibaba20 sourced · 20 rankable · 0 generated
●●●●High47.63provisional score
Claude Opus 5Anthropic80 sourced · 80 rankable · 0 generated
●●●○Good79.89provisional score
Claude Opus 5.5Anthropic56 sourced · 56 rankable · 0 generated
●●●○Good87.68provisional score
Qwen3.8 MaxAlibaba55 sourced · 17 rankable · 0 generated
●●●○Good72.1provisional score
Kimi K3Moonshot AI54 sourced · 30 rankable · 0 generated
●●●○Good72.12provisional score
Claude Sonnet 5.5Anthropic53 sourced · 53 rankable · 0 generated
●●●○Good83.28provisional score
Qwen3.8-27BAlibaba43 sourced · 43 rankable · 0 generated
●●●○Good57.56provisional score
GPT-6 AstraOpenAI38 sourced · 38 rankable · 0 generated
●●●○Good88.69provisional score
DeepSeek V4 Pro 0813DeepSeek38 sourced · 31 rankable · 0 generated
●●●○Good64.95provisional score
MiniMax M3MiniMax36 sourced · 36 rankable · 0 generated
●●●○Good55.16provisional score
GPT-5.6 LunaOpenAI35 sourced · 35 rankable · 0 generated
●●●○Good66.2provisional score
Kimi K2.6Moonshot AI34 sourced · 34 rankable · 0 generated
●●●○Good60.17provisional score
Claude Sonnet 5Anthropic32 sourced · 32 rankable · 0 generated
●●●○Good67.35provisional score
Muse Spark 1.1Meta32 sourced · 32 rankable · 0 generated
●●●○Good66.6provisional score
Gemini 3.8 FlashGoogle32 sourced · 32 rankable · 0 generated
●●●○Good73.92provisional score
Gemini 3.7 FlashGoogle32 sourced · 32 rankable · 0 generated
●●●○Good67.94provisional score
GLM-5.1Z.AI31 sourced · 31 rankable · 0 generated
●●●○Good57.74provisional score
Ling 3.0 FlashInclusionAI31 sourced · 31 rankable · 0 generated
●●●○Good46.38provisional score
Claude Fable 5Anthropic30 sourced · 30 rankable · 0 generated
●●●○Good79.41provisional score
GLM-5.2Z.AI30 sourced · 30 rankable · 0 generated
●●●○Good63.15provisional score
MiniMax M2.7MiniMax30 sourced · 30 rankable · 0 generated
●●●○Good48.55provisional score
dots3-note PreviewDots Studio30 sourced · 30 rankable · 0 generated
●●●○Good63.59provisional score
Qwen3.8-Flash-NextAlibaba29 sourced · 29 rankable · 0 generated
●●●○Good64.49provisional score
GLM-5.3-FlashZ.AI28 sourced · 28 rankable · 0 generated
●●●○Good58.57provisional score
Step 5 PreviewStepFun27 sourced · 27 rankable · 0 generated
●●●○Good70.35provisional score
Nemotron 3 UltraNVIDIA26 sourced · 22 rankable · 0 generated
●●●○Good45.35provisional score
Gemini 3.1 ProGoogle25 sourced · 25 rankable · 0 generated
●●●○Good65.05provisional score
Grok 4.5xAI23 sourced · 23 rankable · 0 generated
●●●○Good65.63provisional score
Grok 4.20xAI22 sourced · 22 rankable · 0 generated
●●●○Good59.18provisional score
GLM-4.7Z.AI20 sourced · 20 rankable · 0 generated
●●●○Good49.83provisional score
MiMo-V2.5-ProXiaomi20 sourced · 20 rankable · 0 generated
●●●○Good52.62provisional score
Grok 4.3xAI20 sourced · 20 rankable · 0 generated
●●●○Good55.33provisional score
Ternary Bonsai 2 27BPrism ML20 sourced · 20 rankable · 0 generated
●●●○Good53.23provisional score
Gemma 4 12BGoogle19 sourced · 19 rankable · 0 generated
●●●○Good32.08provisional score
Step 3.7 FlashStepFun19 sourced · 19 rankable · 0 generated
●●●○Good44.84provisional score
Gemini 3 ProGoogle18 sourced · 18 rankable · 0 generated
●●●○Good61.55provisional score
GPT-6 SolOpenAI18 sourced · 18 rankable · 0 generated
●●●○Good79.16provisional score
Gemini 3.6 FlashGoogle18 sourced · 18 rankable · 0 generated
●●●○Good65.15provisional score
GPT-6 LunaOpenAI18 sourced · 18 rankable · 0 generated
●●●○Good64.95provisional score
Gemini 3.5 Flash-LiteGoogle18 sourced · 18 rankable · 0 generated
●●●○Good51.53provisional score
MiMo-V2.6-FlashXiaomi17 sourced · 17 rankable · 0 generated
●●●○Good66.36provisional score
Gemini 3 FlashGoogle17 sourced · 17 rankable · 0 generated
●●●○Good56.29provisional score
GPT-5.3 CodexOpenAI16 sourced · 16 rankable · 0 generated
●●●○Good62.46provisional score
Gemma 4 31BGoogle15 sourced · 15 rankable · 0 generated
●●●○Good41.07provisional score
Gemini 2.5 ProGoogle15 sourced · 15 rankable · 0 generated
●●●○Good50.96provisional score
Kimi K2.7 CodeMoonshot AI14 sourced · 14 rankable · 0 generated
●●●○Good54.59provisional score
GPT-4.1OpenAI14 sourced · 14 rankable · 0 generated
●●●○Good39.28provisional score
GPT-4.1 miniOpenAI13 sourced · 13 rankable · 0 generated
●●●○Good31.12provisional score
DeepSeek V3.2DeepSeek12 sourced · 12 rankable · 0 generated
●●●○Good50.93provisional score
GLM-4.6Z.AI12 sourced · 12 rankable · 0 generated
●●●○Good40.38provisional score
GPT-4.1 nanoOpenAI12 sourced · 12 rankable · 0 generated
●●●○Good26.42provisional score
Claude Fable 5.1Anthropic33 sourced · 33 rankable · 0 generated
●●○○Moderate82.82provisional score
GLM-5.3Z.AI32 sourced · 19 rankable · 0 generated
●●○○Moderate65.66provisional score
DeepSeek V4.1 FlashDeepSeek31 sourced · 17 rankable · 0 generated
●●○○Moderate64.63provisional score
Hy4 previewTencent25 sourced · 25 rankable · 0 generated
●●○○Moderate61.09provisional score
Grok 4.6xAI25 sourced · 20 rankable · 0 generated
●●○○Moderate69.38provisional score
Granite 4.2 8BIBM20 sourced · 20 rankable · 0 generated
●●○○Moderate32.13provisional score
Gemini 4 ArgonGoogle18 sourced · 18 rankable · 0 generated
●●○○Moderate77.18provisional score
Apodex 1.1Apodex18 sourced · 18 rankable · 0 generated
●●○○Moderate52.18provisional score
Ornith-1.5-397BOrnith AI18 sourced · 18 rankable · 0 generated
●●○○Moderate62.7provisional score
Ornith-1.5-35B-A3BOrnith AI18 sourced · 18 rankable · 0 generated
●●○○Moderate32.56provisional score
GPT-6.1 SolOpenAI17 sourced · 17 rankable · 0 generated
●●○○Moderate77.55provisional score
MiMo-V2.6-ProXiaomi17 sourced · 17 rankable · 0 generated
●●○○Moderate75.49provisional score
Ornith-1.5-9BOrnith AI16 sourced · 16 rankable · 0 generated
●●○○Moderate28.6provisional score
Muse Spark 1.2Meta15 sourced · 15 rankable · 0 generated
●●○○Moderate65.7provisional score
Gemma 4 26B A4BGoogle13 sourced · 13 rankable · 0 generated
●●○○Moderate46.88provisional score
Command A+Cohere13 sourced · 13 rankable · 0 generated
●●○○Moderate36.6provisional score
LFM2.5-2.6BLiquidAI13 sourced · 13 rankable · 0 generated
●●○○Moderate30.95provisional score
MiniCPM5-1BOpenBMB13 sourced · 13 rankable · 0 generated
●●○○Moderate4.77provisional score
Mercury 2.5Inception12 sourced · 12 rankable · 0 generated
●●○○Moderate35.18provisional score
Trinity-Large-ThinkingArcee AI12 sourced · 12 rankable · 0 generated
●●○○Moderate34.86provisional score
Hy3 PreviewTencent12 sourced · 8 rankable · 0 generated
●●○○Moderate51.37provisional score
LFM2.5-8B-A1BLiquidAI12 sourced · 12 rankable · 0 generated
●●○○Moderate29.76provisional score
GPT-5.2-CodexOpenAI11 sourced · 11 rankable · 0 generated
●●○○Moderate56.74provisional score
GPT-5.4 ProOpenAI11 sourced · 11 rankable · 0 generated
●●○○Moderate70.72provisional score
GPT-5.1OpenAI11 sourced · 11 rankable · 0 generated
●●○○Moderate58.95provisional score
Claude Opus 4.7Anthropic11 sourced · 11 rankable · 0 generated
●●○○Moderate65.81provisional score
Qwen 3.6 Max (preview)Alibaba11 sourced · 11 rankable · 0 generated
●●○○Moderate53.44provisional score
GPT-5.1-CodexOpenAI10 sourced · 10 rankable · 0 generated
●●○○Moderate51provisional score
o1OpenAI10 sourced · 10 rankable · 0 generated
●●○○Moderate40.06provisional score
Grok 4xAI10 sourced · 10 rankable · 0 generated
●●○○Moderate53.37provisional score
ZAYA1-8BZyphra10 sourced · 10 rankable · 0 generated
●●○○Moderate31.61provisional score
Llama 4 MaverickMeta10 sourced · 10 rankable · 0 generated
●●○○Moderate23.58provisional score
Llama 4 ScoutMeta10 sourced · 10 rankable · 0 generated
●●○○Moderate30.09provisional score
Claude Haiku 4.5Anthropic10 sourced · 10 rankable · 0 generated
●●○○Moderate42.4provisional score
Ling 2.6 FlashInclusionAI10 sourced · 10 rankable · 0 generated
●●○○Moderate32.83provisional score
GPT-5.5 ProOpenAI9 sourced · 9 rankable · 0 generated
●●○○Moderate74.62provisional score
o3OpenAI9 sourced · 9 rankable · 0 generated
●●○○Moderate47.72provisional score
GPT-OSS 120BOpenAI9 sourced · 9 rankable · 0 generated
●●○○Moderate38.37provisional score
Gemini 3.1 Flash-LiteGoogle9 sourced · 9 rankable · 0 generated
●●○○Moderate49.49provisional score
Claude 4 SonnetAnthropic9 sourced · 9 rankable · 0 generated
●●○○Moderate38.6provisional score
Gemini 2.5 FlashGoogle9 sourced · 9 rankable · 0 generated
●●○○Moderate43.73provisional score
Solar Pro 3Upstage9 sourced · 8 rankable · 0 generated
●●○○Moderate30.38provisional score
Mistral Small 4Mistral9 sourced · 9 rankable · 0 generated
●●○○Moderate35.08provisional score
GPT-OSS 20BOpenAI9 sourced · 9 rankable · 0 generated
●●○○Moderate34.27provisional score
MiMo-V2-FlashXiaomi9 sourced · 9 rankable · 0 generated
●●○○Moderate41.61provisional score
Mistral Large 3Mistral9 sourced · 9 rankable · 0 generated
●●○○Moderate33.63provisional score
DeepSeek V3DeepSeek9 sourced · 9 rankable · 0 generated
●●○○Moderate32.58provisional score
Claude Sonnet 4.5Anthropic9 sourced · 9 rankable · 0 generated
●●○○Moderate49.13provisional score
Gemma 3 27BGoogle9 sourced · 9 rankable · 0 generated
●●○○Moderate29.46provisional score
GPT-4oOpenAI8 sourced · 8 rankable · 0 generated
●●○○Moderate30.04provisional score
GLM-5V-TurboZ.AI8 sourced · 8 rankable · 0 generated
●●○○Moderate50.48provisional score
Ling 3.0 Flash VLInclusionAI8 sourced · 8 rankable · 0 generated
●●○○Moderate47.67provisional score
MiMo-V2-OmniXiaomi8 sourced · 8 rankable · 0 generated
●●○○Moderate50.99provisional score
Kimi K2Moonshot AI8 sourced · 8 rankable · 0 generated
●●○○Moderate29.64provisional score
Gemma 4 E4BGoogle8 sourced · 8 rankable · 0 generated
●●○○Moderate31.47provisional score
Gemma 4 E2BGoogle8 sourced · 8 rankable · 0 generated
●●○○Moderate30.34provisional score
Celeris-1Celeris11 sourced · 11 rankable · 0 generated
●○○○Low / Estimated~28.9provisional score
Quasar 438BMultiverse Computing9 sourced · 9 rankable · 0 generated
●○○○Low / Estimated~49.83provisional score
GPT-5 (medium)OpenAI7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~47.05provisional score
Hy3Tencent7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~53.22provisional score
GLM-5-TurboZ.AI7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~54.65provisional score
MiMo-V2-ProXiaomi7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~54.2provisional score
Exaone 4.0 32BLG AI Research7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~28.88provisional score
K-ExaoneLG AI Research7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~38.12provisional score
Qwen3 MaxAlibaba7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~41.08provisional score
o3-miniOpenAI7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~40.84provisional score
Mistral Medium 3Mistral7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~30.11provisional score
Grok Code Fast 1xAI7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~34.57provisional score
Grok 4.1 FastxAI7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~36.69provisional score
Claude 3 HaikuAnthropic7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~15.61provisional score
Nova ProAmazon7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~22.15provisional score
Phi-4Microsoft7 sourced · 7 rankable · 0 generated
●○○○Low / Estimated~26.37provisional score
Claude 4.1 Opus ThinkingAnthropic6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~40.46provisional score
Qwen3.5 FlashAlibaba6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~45.07provisional score
DeepSeek-R1DeepSeek6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~43.34provisional score
Agents-A1InternScience6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~53.4provisional score
DeepSeek V3.1DeepSeek6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~41.88provisional score
GLM-4.5-AirZ.AI6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~35.3provisional score
Sarvam 105BSarvam6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~31.34provisional score
Solar Pro 2Upstage6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~29.54provisional score
Granite-4.0-H-1BIBM6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~27.77provisional score
Sarvam 30BSarvam6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~29.11provisional score
Granite-4.0-350MIBM6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~27.42provisional score
Granite-4.0-H-350MIBM6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~27.42provisional score
Exaone 4.0 1.2BLG AI Research6 sourced · 6 rankable · 0 generated
●○○○Low / Estimated~27.81provisional score
Mistral Large 2Mistral5 sourced · 5 rankable · 0 generated
●○○○Low / Estimated~28.9provisional score
GPT-4o miniOpenAI5 sourced · 5 rankable · 0 generated
●○○○Low / Estimated~27.57provisional score
Qwen3.5 PlusAlibaba4 sourced · 4 rankable · 0 generated
●○○○Low / Estimated~49.44provisional score
Gemini 1.5 ProGoogle3 sourced · 3 rankable · 0 generated
●○○○Low / Estimated~28.15provisional score
Claude 4.1 OpusAnthropic2 sourced · 2 rankable · 0 generated
●○○○Low / Estimated~40.85provisional score
Grok 3 [Beta]xAI2 sourced · 2 rankable · 0 generated
●○○○Low / Estimated~44.5provisional score
Claude 3.5 SonnetAnthropic2 sourced · 2 rankable · 0 generated
●○○○Low / Estimated~29.6provisional score
Claude 3 OpusAnthropic2 sourced · 2 rankable · 0 generated
●○○○Low / Estimated~29.32provisional score
Gemini 1.0 ProGoogle2 sourced · 2 rankable · 0 generated
●○○○Low / Estimated~13.93provisional score
MiniMax M2.5MiniMax1 sourced · 1 rankable · 41 generated
●○○○Low / Estimated~50.38provisional score
o1-previewOpenAI1 sourced · 1 rankable · 0 generated
●○○○Low / Estimated~36.97provisional score
GPT-5 miniOpenAI1 sourced · 1 rankable · 50 generated
●○○○Low / Estimated~44.75provisional score
o3-proOpenAI1 sourced · 1 rankable · 0 generated
●○○○Low / Estimated~47.88provisional score
GPT-4 TurboOpenAI1 sourced · 1 rankable · 0 generated
●○○○Low / Estimated~22.31provisional score
GPT-5.2 ProOpenAI0 sourced · 0 rankable · 4 generated
●○○○Low / Estimated~68.23provisional score
Step 3.5 FlashStepFun0 sourced · 0 rankable · 22 generated
●○○○Low / Estimated~42.66provisional score
GLM-4.7-FlashZ.AI0 sourced · 0 rankable · 34 generated
●○○○Low / Estimated~39.78provisional score
Mercury 2Inception0 sourced · 0 rankable · 29 generated
●○○○Low / Estimated~35.82provisional score
Qwen2.5-72BAlibaba0 sourced · 0 rankable · 0 generated
●○○○Low / Estimated~30.36provisional score
Llama 3.1 405BMeta0 sourced · 0 rankable · 0 generated
●○○○Low / Estimated~29.81provisional score
Llama 3 70BMeta0 sourced · 0 rankable · 0 generated
●○○○Low / Estimated~22.78provisional score
Ministral 3 14BMistral0 sourced · 0 rankable · 18 generated
●○○○Low / Estimated~25.39provisional score
Nemotron-4 15BNVIDIA0 sourced · 0 rankable · 0 generated
●○○○Low / Estimated~10.05provisional score
LFM2-24B-A2BLiquidAI0 sourced · 0 rankable · 12 generated
●○○○Low / Estimated~21.1provisional score
Ministral 3 8BMistral0 sourced · 0 rankable · 18 generated
●○○○Low / Estimated~20.46provisional score
Mistral 7B v0.3Mistral0 sourced · 0 rankable · 0 generated
●○○○Low / Estimated~7.24provisional score
LFM2.5-1.2B-ThinkingLiquidAI0 sourced · 0 rankable · 12 generated
●○○○Low / Estimated~19.84provisional score
MiniMax M1 80kMiniMax0 sourced · 0 rankable · 34 generated
●○○○Low / Estimated~27.81provisional score
Ministral 3 3BMistral0 sourced · 0 rankable · 18 generated
●○○○Low / Estimated~19.27provisional score
LFM2.5-1.2B-InstructLiquidAI0 sourced · 0 rankable · 12 generated
●○○○Low / Estimated~19.59provisional score
Qwen3.7 FlashAlibaba0 sourced · 0 rankable · 0 generated
●○○○Low / Estimated~49.05provisional score
Agents-A1-F16-GGUFInternScience0 sourced · 0 rankable · 0 generated
●○○○Low / Estimated~53.4provisional score
Agents-A1-FP8InternScience0 sourced · 0 rankable · 0 generated
●○○○Low / Estimated~53.4provisional score
Agents-A1-Q4_K_M-GGUFInternScience0 sourced · 0 rankable · 0 generated
●○○○Low / Estimated~53.4provisional score
Agents-A1-Q8_0-GGUFInternScience0 sourced · 0 rankable · 0 generated
●○○○Low / Estimated~53.4provisional score
GPT-5 nanoOpenAI0 sourced · 0 rankable · 17 generated
●○○○Low / Estimated~37.08provisional score
Grok 3 MinixAI0 sourced · 0 rankable · 0 generated
●○○○Low / Estimated~44.13provisional score
o1-proOpenAI0 sourced · 0 rankable · 0 generated
●○○○Low / Estimated~36provisional score

Sourced = exact-source benchmark coverage. Rankable = non-generated benchmark coverage used by the provisional leaderboard. Generated = inferred from related models and excluded from ranking. Coverage = sourced share of the visible benchmark footprint.

Questions

What is benchmark confidence on BenchLM?

Score confidence (1-4 dots) indicates how much sourced benchmark data supports a model's score. A 4-dot score has at least 20 sourced rows across seven categories. A 1-dot score has limited coverage. Some benchmark-sparse models can appear provisionally when several independent public evaluation families agree.

What does "estimated" mean on BenchLM scores?

Scores marked with "Est." or "~" have limited source-backed benchmark coverage or qualify through corroborating external evaluation families. Unresolved manual values and generated rows cannot score. The verified leaderboard requires sourced benchmark support; external consensus alone never upgrades an estimated row to verified status.

How does BenchLM detect contamination risk?

BenchLM tracks two key signals: (1) benchmark provenance — whether each score is a hand-entered public row ("manual") or was generated/inferred from related data, and (2) benchmark freshness — older benchmarks that haven't been updated are more likely to have been contaminated through training data inclusion. Models with mostly generated data or stale benchmarks receive lower confidence ratings. Exact-source verification is tracked separately from this manual-vs-generated split.

What is benchmark provenance?

Provenance records where each benchmark value came from and whether the exact model, benchmark variant, harness, and score can be supported. Source-backed rows can score. Unresolved manual values and generated estimates remain in the audit trail but do not affect either public ranking view.

Which LLM benchmarks are most reliable?

Fresh, held-out benchmarks like SWE-Rebench (rolling window), Terminal-Bench 2.0, and HLE are the hardest to game. Older, saturated benchmarks like MMLU (where top models all score 97-99%) provide little signal. BenchLM weights newer, harder benchmarks more heavily and flags saturated ones as display-only.

Know when it’s worth switching models

The model to choose, the cheaper alternative, and the release we would wait on.

Read a sample issue

Join 2,000+ readers.

One email each week. Unsubscribe anytime.