Model / evidenceConfidence / score
●●●●High56.54provisional score
●●●●High55.19provisional score
●●●●High55.64provisional score
●●●●High44.71provisional score
Kimi K2.5Moonshot AI48 sourced · 48 rankable · 0 generated ●●●●High53.65provisional score
Qwen3.7 MaxAlibaba47 sourced · 47 rankable · 0 generated ●●●●High63.44provisional score
Qwen3.6-27BAlibaba47 sourced · 47 rankable · 0 generated ●●●●High49.3provisional score
●●●●High70.8provisional score
GPT-5.5OpenAI43 sourced · 43 rankable · 0 generated ●●●●High69.38provisional score
GPT-5.6 SolOpenAI42 sourced · 42 rankable · 0 generated ●●●●High78.91provisional score
GPT-5.4OpenAI40 sourced · 40 rankable · 0 generated ●●●●High68.89provisional score
GLM-5Z.AI40 sourced · 40 rankable · 0 generated ●●●●High55.04provisional score
●●●●High73.18provisional score
●●●●High63.93provisional score
●●●●High64.25provisional score
InklingThinking Machines Lab34 sourced · 34 rankable · 0 generated ●●●●High54.78provisional score
Muse SparkMeta33 sourced · 33 rankable · 0 generated ●●●●High61.23provisional score
Inkling-SmallThinking Machines Lab32 sourced · 32 rankable · 0 generated ●●●●High55.09provisional score
●●●●High56.86provisional score
●●●●High55.63provisional score
●●●●High51.44provisional score
●●●●High42.27provisional score
●●●●High41.65provisional score
GPT-5.2OpenAI20 sourced · 20 rankable · 0 generated ●●●●High61.92provisional score
Qwen3.5-27BAlibaba20 sourced · 20 rankable · 0 generated ●●●●High48.31provisional score
●●●●High47.63provisional score
●●●○Good79.89provisional score
●●●○Good87.68provisional score
Qwen3.8 MaxAlibaba55 sourced · 17 rankable · 0 generated ●●●○Good72.1provisional score
Kimi K3Moonshot AI54 sourced · 30 rankable · 0 generated ●●●○Good72.12provisional score
●●●○Good83.28provisional score
Qwen3.8-27BAlibaba43 sourced · 43 rankable · 0 generated ●●●○Good57.56provisional score
GPT-6 AstraOpenAI38 sourced · 38 rankable · 0 generated ●●●○Good88.69provisional score
●●●○Good64.95provisional score
MiniMax M3MiniMax36 sourced · 36 rankable · 0 generated ●●●○Good55.16provisional score
●●●○Good66.2provisional score
Kimi K2.6Moonshot AI34 sourced · 34 rankable · 0 generated ●●●○Good60.17provisional score
●●●○Good67.35provisional score
●●●○Good66.6provisional score
●●●○Good73.92provisional score
●●●○Good67.94provisional score
GLM-5.1Z.AI31 sourced · 31 rankable · 0 generated ●●●○Good57.74provisional score
●●●○Good46.38provisional score
●●●○Good79.41provisional score
GLM-5.2Z.AI30 sourced · 30 rankable · 0 generated ●●●○Good63.15provisional score
●●●○Good48.55provisional score
●●●○Good63.59provisional score
●●●○Good64.49provisional score
●●●○Good58.57provisional score
●●●○Good70.35provisional score
●●●○Good45.35provisional score
●●●○Good65.05provisional score
Grok 4.5xAI23 sourced · 23 rankable · 0 generated ●●●○Good65.63provisional score
●●●○Good31.28provisional score
Grok 4.20xAI22 sourced · 22 rankable · 0 generated ●●●○Good59.18provisional score
●●●○Good69.63provisional score
●●●○Good36.17provisional score
GLM-4.7Z.AI20 sourced · 20 rankable · 0 generated ●●●○Good49.83provisional score
●●●○Good52.62provisional score
Grok 4.3xAI20 sourced · 20 rankable · 0 generated ●●●○Good55.33provisional score
●●●○Good53.23provisional score
Gemma 4 12BGoogle19 sourced · 19 rankable · 0 generated ●●●○Good32.08provisional score
●●●○Good44.84provisional score
●●●○Good61.55provisional score
GPT-6 SolOpenAI18 sourced · 18 rankable · 0 generated ●●●○Good79.16provisional score
●●●○Good65.15provisional score
GPT-6 LunaOpenAI18 sourced · 18 rankable · 0 generated ●●●○Good64.95provisional score
●●●○Good51.53provisional score
●●●○Good66.36provisional score
●●●○Good56.29provisional score
●●●○Good62.46provisional score
Gemma 4 31BGoogle15 sourced · 15 rankable · 0 generated ●●●○Good41.07provisional score
●●●○Good50.96provisional score
●●●○Good54.59provisional score
GPT-4.1OpenAI14 sourced · 14 rankable · 0 generated ●●●○Good39.28provisional score
●●●○Good20.13provisional score
●●●○Good31.12provisional score
●●●○Good50.93provisional score
GLM-4.6Z.AI12 sourced · 12 rankable · 0 generated ●●●○Good40.38provisional score
●●●○Good26.42provisional score
●●○○Moderate82.82provisional score
GLM-5.3Z.AI32 sourced · 19 rankable · 0 generated ●●○○Moderate65.66provisional score
●●○○Moderate64.63provisional score
Hy4 previewTencent25 sourced · 25 rankable · 0 generated ●●○○Moderate61.09provisional score
Grok 4.6xAI25 sourced · 20 rankable · 0 generated ●●○○Moderate69.38provisional score
●●○○Moderate32.13provisional score
●●○○Moderate77.18provisional score
Apodex 1.1Apodex18 sourced · 18 rankable · 0 generated ●●○○Moderate52.18provisional score
●●○○Moderate62.7provisional score
●●○○Moderate32.56provisional score
GPT-6.1 SolOpenAI17 sourced · 17 rankable · 0 generated ●●○○Moderate77.55provisional score
●●○○Moderate75.49provisional score
●●○○Moderate28.6provisional score
●●○○Moderate65.7provisional score
●●○○Moderate46.88provisional score
Command A+Cohere13 sourced · 13 rankable · 0 generated ●●○○Moderate36.6provisional score
LFM2.5-2.6BLiquidAI13 sourced · 13 rankable · 0 generated ●●○○Moderate30.95provisional score
MiniCPM5-1BOpenBMB13 sourced · 13 rankable · 0 generated ●●○○Moderate4.77provisional score
Mercury 2.5Inception12 sourced · 12 rankable · 0 generated ●●○○Moderate35.18provisional score
●●○○Moderate34.86provisional score
Hy3 PreviewTencent12 sourced · 8 rankable · 0 generated ●●○○Moderate51.37provisional score
●●○○Moderate29.76provisional score
●●○○Moderate56.74provisional score
GPT-5.4 ProOpenAI11 sourced · 11 rankable · 0 generated ●●○○Moderate70.72provisional score
GPT-5.1OpenAI11 sourced · 11 rankable · 0 generated ●●○○Moderate58.95provisional score
●●○○Moderate65.81provisional score
●●○○Moderate53.44provisional score
●●○○Moderate51provisional score
o1OpenAI10 sourced · 10 rankable · 0 generated ●●○○Moderate40.06provisional score
Grok 4xAI10 sourced · 10 rankable · 0 generated ●●○○Moderate53.37provisional score
ZAYA1-8BZyphra10 sourced · 10 rankable · 0 generated ●●○○Moderate31.61provisional score
●●○○Moderate23.58provisional score
●●○○Moderate30.09provisional score
●●○○Moderate42.4provisional score
●●○○Moderate32.83provisional score
●●○○Moderate74.62provisional score
o3OpenAI9 sourced · 9 rankable · 0 generated ●●○○Moderate47.72provisional score
●●○○Moderate38.37provisional score
●●○○Moderate49.49provisional score
●●○○Moderate38.6provisional score
●●○○Moderate43.73provisional score
●●○○Moderate30.38provisional score
●●○○Moderate35.08provisional score
●●○○Moderate34.27provisional score
●●○○Moderate41.61provisional score
●●○○Moderate33.63provisional score
DeepSeek V3DeepSeek9 sourced · 9 rankable · 0 generated ●●○○Moderate32.58provisional score
●●○○Moderate49.13provisional score
●●○○Moderate29.46provisional score
GPT-4oOpenAI8 sourced · 8 rankable · 0 generated ●●○○Moderate30.04provisional score
●●○○Moderate55.64provisional score
●●○○Moderate50.48provisional score
●●○○Moderate47.67provisional score
●●○○Moderate50.99provisional score
●●○○Moderate46.84provisional score
●●○○Moderate43.91provisional score
Kimi K2Moonshot AI8 sourced · 8 rankable · 0 generated ●●○○Moderate29.64provisional score
●●○○Moderate31.47provisional score
●●○○Moderate30.34provisional score
Celeris-1Celeris11 sourced · 11 rankable · 0 generated ●○○○Low / Estimated~28.9provisional score
Quasar 438BMultiverse Computing9 sourced · 9 rankable · 0 generated ●○○○Low / Estimated~49.83provisional score
●○○○Low / Estimated~47.05provisional score
Hy3Tencent7 sourced · 7 rankable · 0 generated ●○○○Low / Estimated~53.22provisional score
●○○○Low / Estimated~54.65provisional score
●○○○Low / Estimated~54.2provisional score
●○○○Low / Estimated~28.88provisional score
K-ExaoneLG AI Research7 sourced · 7 rankable · 0 generated ●○○○Low / Estimated~38.12provisional score
Qwen3 MaxAlibaba7 sourced · 7 rankable · 0 generated ●○○○Low / Estimated~41.08provisional score
o3-miniOpenAI7 sourced · 7 rankable · 0 generated ●○○○Low / Estimated~40.84provisional score
●○○○Low / Estimated~30.11provisional score
●○○○Low / Estimated~34.57provisional score
●○○○Low / Estimated~36.69provisional score
●○○○Low / Estimated~15.61provisional score
Nova ProAmazon7 sourced · 7 rankable · 0 generated ●○○○Low / Estimated~22.15provisional score
●○○○Low / Estimated~28.57provisional score
Phi-4Microsoft7 sourced · 7 rankable · 0 generated ●○○○Low / Estimated~26.37provisional score
●○○○Low / Estimated~40.46provisional score
●○○○Low / Estimated~45.07provisional score
●○○○Low / Estimated~39.24provisional score
DeepSeek-R1DeepSeek6 sourced · 6 rankable · 0 generated ●○○○Low / Estimated~43.34provisional score
Agents-A1InternScience6 sourced · 6 rankable · 0 generated ●○○○Low / Estimated~53.4provisional score
●○○○Low / Estimated~41.88provisional score
●○○○Low / Estimated~35.3provisional score
●○○○Low / Estimated~31.34provisional score
●○○○Low / Estimated~29.54provisional score
●○○○Low / Estimated~27.77provisional score
Sarvam 30BSarvam6 sourced · 6 rankable · 0 generated ●○○○Low / Estimated~29.11provisional score
●○○○Low / Estimated~27.42provisional score
●○○○Low / Estimated~27.42provisional score
●○○○Low / Estimated~27.81provisional score
●○○○Low / Estimated~28.9provisional score
●○○○Low / Estimated~27.57provisional score
●○○○Low / Estimated~49.44provisional score
●○○○Low / Estimated~32.35provisional score
●○○○Low / Estimated~28.15provisional score
●○○○Low / Estimated~40.85provisional score
●○○○Low / Estimated~44.5provisional score
●○○○Low / Estimated~29.6provisional score
●○○○Low / Estimated~29.32provisional score
●○○○Low / Estimated~27.09provisional score
●○○○Low / Estimated~13.93provisional score
●○○○Low / Estimated~50.38provisional score
o1-previewOpenAI1 sourced · 1 rankable · 0 generated ●○○○Low / Estimated~36.97provisional score
GPT-5 miniOpenAI1 sourced · 1 rankable · 50 generated ●○○○Low / Estimated~44.75provisional score
o3-proOpenAI1 sourced · 1 rankable · 0 generated ●○○○Low / Estimated~47.88provisional score
●○○○Low / Estimated~22.31provisional score
●○○○Low / Estimated~68.23provisional score
●○○○Low / Estimated~42.66provisional score
●○○○Low / Estimated~39.78provisional score
Mercury 2Inception0 sourced · 0 rankable · 29 generated ●○○○Low / Estimated~35.82provisional score
●○○○Low / Estimated~30.36provisional score
●○○○Low / Estimated~29.81provisional score
●○○○Low / Estimated~22.78provisional score
●○○○Low / Estimated~25.39provisional score
●○○○Low / Estimated~19.78provisional score
●○○○Low / Estimated~10.05provisional score
●○○○Low / Estimated~21.1provisional score
●○○○Low / Estimated~20.46provisional score
●○○○Low / Estimated~7.24provisional score
●○○○Low / Estimated~19.84provisional score
●○○○Low / Estimated~27.81provisional score
●○○○Low / Estimated~19.27provisional score
●○○○Low / Estimated~19.59provisional score
●○○○Low / Estimated~49.05provisional score
●○○○Low / Estimated~53.4provisional score
●○○○Low / Estimated~53.4provisional score
●○○○Low / Estimated~53.4provisional score
●○○○Low / Estimated~53.4provisional score
GPT-5 nanoOpenAI0 sourced · 0 rankable · 17 generated ●○○○Low / Estimated~37.08provisional score
●○○○Low / Estimated~44.13provisional score
o1-proOpenAI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~36provisional score
Sourced = exact-source benchmark coverage. Rankable = non-generated benchmark coverage used by the provisional leaderboard. Generated = inferred from related models and excluded from ranking. Coverage = sourced share of the visible benchmark footprint.