Skip to main content

BenchLM recommendation

Best Reasoning AI Models in 2026

Data verified

Claude Mythos 5 leads reasoning ai models on BenchLM's July 2026 rankings with a score of 83.9, ahead of Claude Fable 5 (83.7) and GPT-5.6 Sol (82). Each row uses the public BenchAlign v5 contract and shows its evidence status.

Last verified: July 20, 2026

Top AI models with dedicated reasoning capabilities, ranked by benchmark performance.

Unless noted otherwise, ranking surfaces on this page use BenchLM's provisional leaderboard lane rather than the stricter sourced-only verified leaderboard.

Bottom line: Reasoning models (chain-of-thought) dominate the top of the leaderboard. Claude Fable 5 leads, but they cost more and are slower. Choose reasoning when accuracy matters more than speed.

Claude Mythos 5 leads this ranking with a score of 83.9, followed by Claude Fable 5 (83.7) and GPT-5.6 Sol (82). The top three are separated by just a few points — any of them would perform well for this use case.

The best open-weight option is GLM-5.1 (ranked #15 with a score of 67.7). Proprietary models hold a clear advantage in this category, though open-weight options may suffice for less demanding use cases.

This ranking is based on provisional overall weighted scores across BenchLM.ai's scoring formula tracked by BenchLM.ai. For detailed model profiles, click any model name below. To compare two specific models head-to-head, use the "vs #" links.

What changed

Claude Fable 5 leads all reasoning models with the highest overall score.

GPT-5.4 best OpenAI reasoning model — leads knowledge at 98.

GPT-5.4 Pro premium tier with perfect multimodal and math scores.

How to choose

Full Rankings (108 models)

1
Claude Mythos 5
Anthropic·Proprietary·1M+

83.9

BenchAlign v5

2
Claude Fable 5
Anthropic·Proprietary·1M+

83.7

BenchAlign v5

3
GPT-5.6 Sol
OpenAI·Proprietary·1M

82

BenchAlign v5

4
Kimi K3
Moonshot AI·Pending·1.05M

81

BenchAlign v5

5
Claude Opus 4.8
Anthropic·Proprietary·1M

78.3

BenchAlign v5

6
Muse Spark 1.1
Meta·Proprietary·1M

77.4

BenchAlign v5

7
Grok 4.5
xAI·Proprietary·500K

76.7

BenchAlign v5

8
GPT-5.4
OpenAI·Proprietary·1.05M

74.2

BenchAlign v5

9
GPT-5.5
OpenAI·Proprietary·1M

73.5

BenchAlign v5

10
Qwen3.7 Max
Alibaba·Proprietary·1M

72.8

BenchAlign v5

11
GPT-5.6 Terra
OpenAI·Proprietary·1M

72.6

BenchAlign v5

12
Muse Spark
Meta·Proprietary·262K

71

BenchAlign v5

13
MiMo-V2.5-Pro
Xiaomi·Proprietary·1M

70.2

BenchAlign v5

14
MiMo-V2-Pro
Xiaomi·Proprietary·1M

67.8

BenchAlign v5

15
GLM-5.1
Z.AI·Open Weight·203K

67.7

BenchAlign v5

16
Qwen3.7 Plus
Alibaba·Proprietary·1M

67.2

BenchAlign v5

17
GPT-5.6 Luna
OpenAI·Proprietary·1M

67.2

BenchAlign v5

18
GPT-5.2 Pro
OpenAI·Proprietary·400K

67

BenchAlign v5

19
GLM-5-Turbo
Z.AI·Proprietary·200K

66.9

BenchAlign v5

20
GPT-5.4 nano
OpenAI·Proprietary·400K

66.8

BenchAlign v5

21
GPT-5.3 Codex
OpenAI·Proprietary·400K

66.7

BenchAlign v5

22
Claude Opus 4.7 (Adaptive)
Anthropic·Proprietary·1M

66.3

BenchAlign v5

23
Claude Sonnet 5
Anthropic·Proprietary·1M

65.3

BenchAlign v5

24
Qwen3.6 Plus
Alibaba·Proprietary·1M

65.2

BenchAlign v5

25
Grok 4.3
xAI·Proprietary·1M

65.1

BenchAlign v5

26
Gemini 3.5 Flash
Google·Proprietary·1M

64.8

BenchAlign v5

27
Claude Opus 4.6 (Adaptive)
Anthropic·Proprietary·1M

64.2

BenchAlign v5

28
GLM-5.2
Z.AI·Open Weight·1M

64

BenchAlign v5

29
GPT-5.5 Pro
OpenAI·Proprietary·1M

63.7

BenchAlign v5

30
MiMo-V2-Omni
Xiaomi·Proprietary·262K

63.2

BenchAlign v5

31
Gemini 3 Pro Deep Think
Google·Proprietary·2M

61.3

BenchAlign v5

32
GLM-4.7
Z.AI·Open Weight·200K

61.2

BenchAlign v5

33
Gemma 4 31B
Google·Open Weight·256K

61.1

BenchAlign v5

34
GPT-5.4 Pro
OpenAI·Proprietary·1.05M

60.9

BenchAlign v5

35
Qwen3.5-27B
Alibaba·Open Weight·262K

60.7

BenchAlign v5

36
Qwen3.5-122B-A10B
Alibaba·Open Weight·262K

60.6

BenchAlign v5

37
Grok 4.1 Fast (Reasoning)
xAI·Proprietary·2M

60.5

BenchAlign v5

38
GLM-5 (Reasoning)
Z.AI·Open Weight·200K

59.8

BenchAlign v5

39
Qwen 3.6 Max (preview)
Alibaba·Proprietary·256K

59.7

BenchAlign v5

40
Qwen3.5 397B (Reasoning)
Alibaba·Open Weight·128K

59.5

BenchAlign v5

41
Kimi K2.5 (Reasoning)
Moonshot AI·Proprietary·128K

59.4

BenchAlign v5

42
GPT-5.2-Codex
OpenAI·Proprietary·400K

59.1

BenchAlign v5

43
GPT-5.2 Instant
OpenAI·Proprietary·128K

59

BenchAlign v5

44
GPT-5.3 Instant
OpenAI·Proprietary·400K

58.9

BenchAlign v5

45
MiMo-V2.5
Xiaomi·Proprietary·1M

58.6

BenchAlign v5

46
GPT-5 (high)
OpenAI·Proprietary·128K

58.6

BenchAlign v5

47
GPT-5.2
OpenAI·Proprietary·400K

58.4

BenchAlign v5

48
DeepSeek V3.2 (Thinking)
DeepSeek·Open Weight·128K

58.2

BenchAlign v5

49
Qwen3 235B 2507 (Reasoning)
Alibaba·Open Weight·128K

58

BenchAlign v5

50
Gemma 4 26B A4B
Google·Open Weight·256K

58

BenchAlign v5

51
Claude Opus 4.5 Thinking
Anthropic·Proprietary·200K

57.4

BenchAlign v5

52
Qwen3.5-35B-A3B
Alibaba·Open Weight·262K

57

BenchAlign v5

53
GPT-5.3-Codex-Spark
OpenAI·Proprietary·256K

56.9

BenchAlign v5

54
Kimi K2.6
Moonshot AI·Open Weight·256K

56.8

BenchAlign v5

55
GPT-5.4 mini
OpenAI·Proprietary·400K

56.8

BenchAlign v5

56
Grok 4 Fast (Reasoning)
xAI·Proprietary·2M

56.6

BenchAlign v5

57
Hy3
Tencent·Open Weight·256K

55.6

BenchAlign v5

58
DeepSeek V4 Pro (High)
DeepSeek·Open Weight·1M

55.5

BenchAlign v5

59
GPT-5 (medium)
OpenAI·Proprietary·128K

55.2

BenchAlign v5

60
GLM-4.6
Z.AI·Open Weight·200K

55.1

BenchAlign v5

61
Kimi K2.7 Code
Moonshot AI·Open Weight·256K

55

BenchAlign v5

62
Grok 4.20
xAI·Proprietary·2M

54.7

BenchAlign v5

63
GPT-5.1-Codex-Max
OpenAI·Proprietary·400K

54.5

BenchAlign v5

64
MiMo-V2-Flash
Xiaomi·Open Weight·256K

54.1

BenchAlign v5

65
DeepSeek V4 Flash (High)
DeepSeek·Open Weight·1M

54

BenchAlign v5

66
Qwen3.6-27B
Alibaba·Open Weight·262K

53.8

BenchAlign v5

67
GPT-5.1
OpenAI·Proprietary·200K

53.7

BenchAlign v5

68
DeepSeek V3.1 (Reasoning)
DeepSeek·Open Weight·128K

53.4

BenchAlign v5

69
GPT-5.1-Codex
OpenAI·Proprietary·400K

52.7

BenchAlign v5

70
Trinity-Large-Thinking
Arcee AI·Open Weight·512K

52.3

BenchAlign v5

71
DeepSeek-R1
DeepSeek·Open Weight·128K

51.7

BenchAlign v5

72
Qwen3.6-35B-A3B
Alibaba·Open Weight·262K

51.5

BenchAlign v5

73
Mercury 2
Inception·Proprietary·128K

51.3

BenchAlign v5

74
GLM-4.7-Flash
Z.AI·Open Weight·200K

51.3

BenchAlign v5

75
Step 3.7 Flash
StepFun·Open Weight·256K

50.9

BenchAlign v5

76
Seed 1.6
ByteDance·Proprietary·256K

50.2

BenchAlign v5

77
o4-mini (high)
OpenAI·Proprietary·200K

50

BenchAlign v5

78
DeepSeekMath V2
DeepSeek·Open Weight·128K

49.9

BenchAlign v5

79
Ministral 3 14B (Reasoning)
Mistral·Open Weight·128K

49.3

BenchAlign v5

80
o1-preview
OpenAI·Proprietary·200K

49.1

BenchAlign v5

81
K-Exaone
LG AI Research·Proprietary·256K

48.5

BenchAlign v5

82
o3-pro
OpenAI·Proprietary·200K

48.3

BenchAlign v5

83
Qwen3 Max
Alibaba·Proprietary·1M

48.2

BenchAlign v5

84
o1
OpenAI·Proprietary·200K

48.1

BenchAlign v5

85
o3
OpenAI·Proprietary·200K

47.9

BenchAlign v5

86
Qwen3.5 Flash
Alibaba·Proprietary·1M

47.7

BenchAlign v5

87
Command A+
Cohere·Open Weight·128K

47.5

BenchAlign v5

88
o3-mini
OpenAI·Proprietary·200K

47.4

BenchAlign v5

89
Gemma 4 12B
Google·Open Weight·256K

47.3

BenchAlign v5

90
Qwen3.5 Plus
Alibaba·Proprietary·1M

47.2

BenchAlign v5

91
GPT-5 nano
OpenAI·Proprietary·400K

46.4

BenchAlign v5

92
o1-pro
OpenAI·Proprietary·200K

45.9

BenchAlign v5

93
Seed 1.6 Flash
ByteDance·Proprietary·256K

45.1

BenchAlign v5

94
Nemotron Ultra 253B
NVIDIA·Open Weight·32K

44.4

BenchAlign v5

95
Nemotron 3 Nano Omni 30B A3B
NVIDIA·Open Weight·256K

44.2

BenchAlign v5

96
GPT-5 mini
OpenAI·Proprietary·128K

43.9

BenchAlign v5

97
Gemma 4 E4B
Google·Open Weight·128K

43.2

BenchAlign v5

98
Sarvam 105B
Sarvam·Open Weight·128K

43

BenchAlign v5

99
DeepSeek R1 Distill Qwen 32B
DeepSeek·Open Weight·128K

42.6

BenchAlign v5

100
Gemma 4 E2B
Google·Open Weight·128K

41.8

BenchAlign v5

101
LFM2.5-8B-A1B
LiquidAI·Open Weight·128K

41.4

BenchAlign v5

102
Solar Pro 2
Upstage·Proprietary·128K

41.2

BenchAlign v5

103
Sarvam 30B
Sarvam·Open Weight·64K

40.7

BenchAlign v5

104
Exaone 4.0 32B
LG AI Research·Open Weight·128K

40.4

BenchAlign v5

105
Ministral 3 8B (Reasoning)
Mistral·Open Weight·128K

40.4

BenchAlign v5

106
Ministral 3 3B (Reasoning)
Mistral·Open Weight·128K

39.5

BenchAlign v5

107
Claude 4.1 Opus Thinking
Anthropic·Proprietary·200K

36.6

BenchAlign v5

108
LFM2.5-1.2B-Thinking
LiquidAI·Proprietary·32K

16.2

BenchAlign v5

Key Takeaways

The top model is Claude Mythos 5 by Anthropic with a BenchAlign v5 score of 83.9 and Supported evidence.

The best open-weight model is GLM-5.1 at position #15.

108 models are included in this ranking.

Score in Context

What these scores mean

Reasoning models use chain-of-thought to improve accuracy on complex tasks. They are ranked by the same overall BenchLM score. Reasoning models typically outperform standard models by 10-20 points on math and logic.

Known limitations

Reasoning models are slower and more expensive per token due to longer output chains. The speed/cost trade-off is not reflected in benchmark scores. For latency-sensitive applications, compare with non-reasoning models.

Last updated: July 20, 2026

Choose a model with this week’s evidence

Join 2,000+ readers for ranking moves, pricing changes, and the claims that still need proof.

One email each week. Unsubscribe anytime.