Model / evidenceConfidence / score
●●●●High66.02provisional score
●●●●High63.63provisional score
Kimi K2.5Moonshot AI40 sourced · 40 rankable · 0 generated ●●●●High58.89provisional score
●●●●High64.79provisional score
●●●●High57.46provisional score
GLM-5Z.AI34 sourced · 34 rankable · 0 generated ●●●●High65.61provisional score
Qwen3.7 MaxAlibaba32 sourced · 32 rankable · 0 generated ●●●●High71.6provisional score
●●●●High64.67provisional score
●●●○Good83.07provisional score
●●●○Good51.42provisional score
Qwen3.6-27BAlibaba36 sourced · 36 rankable · 0 generated ●●●○Good53.73provisional score
GPT-5.4OpenAI32 sourced · 32 rankable · 0 generated ●●●○Good73.36provisional score
●●●○Good76.58provisional score
●●●○Good67.98provisional score
GPT-5.5OpenAI29 sourced · 29 rankable · 0 generated ●●●○Good73.37provisional score
Kimi K2.6Moonshot AI29 sourced · 29 rankable · 0 generated ●●●○Good60.21provisional score
GPT-5.6 SolOpenAI23 sourced · 23 rankable · 0 generated ●●●○Good82provisional score
Muse SparkMeta22 sourced · 22 rankable · 0 generated ●●●○Good70.81provisional score
●●●○Good72.91provisional score
●●●○Good67.29provisional score
●●●○Good55.98provisional score
●●●○Good72.13provisional score
●●●○Good64.53provisional score
Inkling-SmallThinking Machines Lab18 sourced · 18 rankable · 0 generated ●●●○Good65.54provisional score
●●●○Good46.67provisional score
InklingThinking Machines Lab16 sourced · 16 rankable · 0 generated ●●●○Good67.04provisional score
●●●○Good53.78provisional score
GPT-5.2OpenAI14 sourced · 14 rankable · 0 generated ●●●○Good58.24provisional score
●●●○Good59.64provisional score
Qwen3.5-27BAlibaba13 sourced · 13 rankable · 0 generated ●●●○Good59.82provisional score
●●●○Good50.93provisional score
●●●○Good56.15provisional score
●●●○Good56.86provisional score
Qwen3.8 MaxAlibaba40 sourced · 9 rankable · 0 generated ●●○○Moderate79.91provisional score
Kimi K3Moonshot AI29 sourced · 9 rankable · 0 generated ●●○○Moderate80.5provisional score
●●○○Moderate61.16provisional score
●●○○Moderate76.88provisional score
Grok 4.20xAI17 sourced · 17 rankable · 0 generated ●●○○Moderate55.19provisional score
●●○○Moderate64.78provisional score
GLM-5.1Z.AI16 sourced · 16 rankable · 0 generated ●●○○Moderate66.91provisional score
GLM-5.2Z.AI15 sourced · 15 rankable · 0 generated ●●○○Moderate63.34provisional score
MiniMax M3MiniMax15 sourced · 15 rankable · 0 generated ●●○○Moderate68.74provisional score
●●○○Moderate83.21provisional score
●●○○Moderate44.4provisional score
●●○○Moderate52.5provisional score
MiniCPM5-1BOpenBMB13 sourced · 13 rankable · 0 generated ●●○○Moderate11.36provisional score
●●○○Moderate26.79provisional score
●●○○Moderate82.96provisional score
●●○○Moderate67.37provisional score
●●○○Moderate66.59provisional score
GPT-5.4 ProOpenAI11 sourced · 11 rankable · 0 generated ●●○○Moderate61.26provisional score
Gemma 4 12BGoogle11 sourced · 11 rankable · 0 generated ●●○○Moderate47.32provisional score
ZAYA1-8BZyphra10 sourced · 10 rankable · 0 generated ●●○○Moderate30.96provisional score
GLM-4.7Z.AI9 sourced · 9 rankable · 0 generated ●●○○Moderate60.66provisional score
Grok 4.5xAI9 sourced · 9 rankable · 0 generated ●●○○Moderate75.42provisional score
●●○○Moderate59.99provisional score
●●○○Moderate54.16provisional score
●●○○Moderate61.36provisional score
●●○○Moderate59.81provisional score
MiMo-V2.5Xiaomi8 sourced · 8 rankable · 0 generated ●●○○Moderate59.16provisional score
●●○○Moderate43.96provisional score
●○○○Low / Estimated~63.06provisional score
●○○○Low / Estimated~50.91provisional score
●○○○Low / Estimated~65.93provisional score
●○○○Low / Estimated~69.21provisional score
●○○○Low / Estimated~64.17provisional score
Grok 4.6xAI6 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~63.41provisional score
Agents-A1InternScience6 sourced · 6 rankable · 0 generated ●○○○Low / Estimated~60.79provisional score
●○○○Low / Estimated~71.87provisional score
●○○○Low / Estimated~54.67provisional score
Grok 4.3xAI6 sourced · 6 rankable · 0 generated ●○○○Low / Estimated~63.95provisional score
GPT-4.1OpenAI6 sourced · 6 rankable · 0 generated ●○○○Low / Estimated~50.84provisional score
●○○○Low / Estimated~60.15provisional score
●○○○Low / Estimated~41.62provisional score
●○○○Low / Estimated~65.29provisional score
●○○○Low / Estimated~59.74provisional score
●○○○Low / Estimated~57.06provisional score
o3-miniOpenAI5 sourced · 5 rankable · 0 generated ●○○○Low / Estimated~46.68provisional score
●○○○Low / Estimated~44.14provisional score
●○○○Low / Estimated~56.63provisional score
o1OpenAI4 sourced · 4 rankable · 0 generated ●○○○Low / Estimated~48.17provisional score
●○○○Low / Estimated~56.45provisional score
●○○○Low / Estimated~47.47provisional score
●○○○Low / Estimated~57.16provisional score
●○○○Low / Estimated~42.2provisional score
●○○○Low / Estimated~56.39provisional score
●○○○Low / Estimated~47.71provisional score
GPT-5.1OpenAI3 sourced · 3 rankable · 0 generated ●○○○Low / Estimated~53.54provisional score
Grok 4xAI3 sourced · 3 rankable · 0 generated ●○○○Low / Estimated~59.61provisional score
GLM-4.6Z.AI3 sourced · 3 rankable · 0 generated ●○○○Low / Estimated~54.34provisional score
●○○○Low / Estimated~44.08provisional score
Command A+Cohere3 sourced · 3 rankable · 0 generated ●○○○Low / Estimated~47.56provisional score
●○○○Low / Estimated~75.54provisional score
●○○○Low / Estimated~40.65provisional score
●○○○Low / Estimated~44.99provisional score
●○○○Low / Estimated~41.97provisional score
●○○○Low / Estimated~50.51provisional score
●○○○Low / Estimated~50.37provisional score
Kimi K2Moonshot AI2 sourced · 2 rankable · 0 generated ●○○○Low / Estimated~26.32provisional score
o3OpenAI2 sourced · 2 rankable · 0 generated ●○○○Low / Estimated~47.01provisional score
●○○○Low / Estimated~58.47provisional score
●○○○Low / Estimated~47.45provisional score
●○○○Low / Estimated~47.27provisional score
●○○○Low / Estimated~40.04provisional score
●○○○Low / Estimated~48.11provisional score
●○○○Low / Estimated~59.08provisional score
●○○○Low / Estimated~58.19provisional score
●○○○Low / Estimated~54.34provisional score
●○○○Low / Estimated~52.77provisional score
●○○○Low / Estimated~53.3provisional score
●○○○Low / Estimated~61.79provisional score
DeepSeek V3DeepSeek1 sourced · 1 rankable · 0 generated ●○○○Low / Estimated~44.28provisional score
GPT-4oOpenAI1 sourced · 1 rankable · 0 generated ●○○○Low / Estimated~40.81provisional score
●○○○Low / Estimated~39.39provisional score
●○○○Low / Estimated~22.76provisional score
●○○○Low / Estimated~64.72provisional score
●○○○Low / Estimated~60.25provisional score
●○○○Low / Estimated~66.08provisional score
●○○○Low / Estimated~66.94provisional score
●○○○Low / Estimated~62.28provisional score
●○○○Low / Estimated~59.71provisional score
●○○○Low / Estimated~62.36provisional score
●○○○Low / Estimated~58.59provisional score
●○○○Low / Estimated~55.8provisional score
●○○○Low / Estimated~58.68provisional score
●○○○Low / Estimated~49.23provisional score
●○○○Low / Estimated~54.9provisional score
●○○○Low / Estimated~42.2provisional score
●○○○Low / Estimated~50.47provisional score
GPT-5 miniOpenAI1 sourced · 1 rankable · 60 generated ●○○○Low / Estimated~43.08provisional score
Qwen3 MaxAlibaba1 sourced · 1 rankable · 0 generated ●○○○Low / Estimated~48.26provisional score
●○○○Low / Estimated~57.46provisional score
●○○○Low / Estimated~61.67provisional score
Grok 4.1xAI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~60.43provisional score
Hy3Tencent0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~68.02provisional score
●○○○Low / Estimated~59.96provisional score
●○○○Low / Estimated~59.47provisional score
●○○○Low / Estimated~66.87provisional score
●○○○Low / Estimated~59.36provisional score
●○○○Low / Estimated~50.57provisional score
●○○○Low / Estimated~52.72provisional score
●○○○Low / Estimated~52.9provisional score
●○○○Low / Estimated~49.54provisional score
GLM-4.5Z.AI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~58.02provisional score
DeepSeek-R1DeepSeek0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~50.95provisional score
●○○○Low / Estimated~57.36provisional score
●○○○Low / Estimated~54.29provisional score
o1-previewOpenAI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~48.42provisional score
●○○○Low / Estimated~46.99provisional score
●○○○Low / Estimated~50.46provisional score
●○○○Low / Estimated~41.04provisional score
●○○○Low / Estimated~46.31provisional score
●○○○Low / Estimated~54.95provisional score
Mercury 2Inception0 sourced · 0 rankable · 55 generated ●○○○Low / Estimated~48.14provisional score
●○○○Low / Estimated~54.29provisional score
●○○○Low / Estimated~40.43provisional score
●○○○Low / Estimated~53.36provisional score
●○○○Low / Estimated~37.22provisional score
●○○○Low / Estimated~41.96provisional score
●○○○Low / Estimated~52.56provisional score
●○○○Low / Estimated~52.11provisional score
●○○○Low / Estimated~51.37provisional score
●○○○Low / Estimated~51.22provisional score
●○○○Low / Estimated~34.03provisional score
●○○○Low / Estimated~50.67provisional score
Seed 1.6ByteDance0 sourced · 0 rankable · 32 generated ●○○○Low / Estimated~50.62provisional score
●○○○Low / Estimated~35provisional score
Phi-4Microsoft0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~22.41provisional score
Qwen2.5-1MAlibaba0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~50.27provisional score
●○○○Low / Estimated~50.27provisional score
●○○○Low / Estimated~50.22provisional score
●○○○Low / Estimated~49.73provisional score
o3-proOpenAI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~47.43provisional score
●○○○Low / Estimated~33.89provisional score
Aion-2.0Aion Labs0 sourced · 0 rankable · 32 generated ●○○○Low / Estimated~49.04provisional score
●○○○Low / Estimated~48.94provisional score
●○○○Low / Estimated~37.79provisional score
●○○○Low / Estimated~26.71provisional score
Z-1Z0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~45.49provisional score
●○○○Low / Estimated~45.44provisional score
●○○○Low / Estimated~45.44provisional score
●○○○Low / Estimated~45.34provisional score
Moonshot v1Moonshot AI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~45.15provisional score
●○○○Low / Estimated~44.95provisional score
●○○○Low / Estimated~44.76provisional score
●○○○Low / Estimated~21.08provisional score
●○○○Low / Estimated~20.68provisional score
●○○○Low / Estimated~18.14provisional score
●○○○Low / Estimated~35.58provisional score
●○○○Low / Estimated~40.72provisional score
Nova ProAmazon0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~19.56provisional score
●○○○Low / Estimated~20.29provisional score
●○○○Low / Estimated~40.24provisional score
●○○○Low / Estimated~40.19provisional score
●○○○Low / Estimated~40.15provisional score
●○○○Low / Estimated~15.53provisional score
●○○○Low / Estimated~39.86provisional score
●○○○Low / Estimated~24.27provisional score
●○○○Low / Estimated~17.82provisional score
●○○○Low / Estimated~39.47provisional score
●○○○Low / Estimated~14.82provisional score
●○○○Low / Estimated~60.79provisional score
●○○○Low / Estimated~60.79provisional score
●○○○Low / Estimated~60.79provisional score
●○○○Low / Estimated~60.79provisional score
●○○○Low / Estimated~42.18provisional score
●○○○Low / Estimated~43.25provisional score
●○○○Low / Estimated~43.14provisional score
Sarvam 30BSarvam0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~40.91provisional score
●○○○Low / Estimated~43.37provisional score
●○○○Low / Estimated~38.76provisional score
●○○○Low / Estimated~38.76provisional score
GPT-5 nanoOpenAI0 sourced · 0 rankable · 28 generated ●○○○Low / Estimated~46.49provisional score
●○○○Low / Estimated~42.76provisional score
o1-proOpenAI0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~46.07provisional score
●○○○Low / Estimated~39.3provisional score
K-ExaoneLG AI Research0 sourced · 0 rankable · 0 generated ●○○○Low / Estimated~47.44provisional score
●○○○Low / Estimated~41.39provisional score
Sourced = exact-source benchmark coverage. Rankable = non-generated benchmark coverage used by the provisional leaderboard. Generated = inferred from related models and excluded from ranking. Coverage = sourced share of the visible benchmark footprint.