BenchLM Leaderboard
BenchAlign leaderboard with Supported and Estimated evidence labels
#ModelCreatorEvidenceScore
1Claude Mythos 5AnthropicSupported83.21
2Claude Opus 5AnthropicSupported83.07
3Claude Fable 5AnthropicSupported82.96
4GPT-5.6 SolOpenAISupported82
5Kimi K3Moonshot AISupported80.5
6Qwen3.8 MaxAlibabaSupported79.91
7Muse Spark 1.1MetaSupported76.88
8Claude Opus 4.8AnthropicSupported76.58
9Gemini 3.6 FlashGoogleSupported75.54
10Grok 4.5xAISupported75.42
LLM benchmark leaderboard by BenchLM.ai