Skip to main content
Radar

Five or fewer confirmed AI changes, with original sources, on mornings when something changed.A free source-linked morning brief.

See the free Radar Brief
BenchLM recommendation

Best AI Models in 2026 — Overall Rankings

Data verified

The best AI model right now is Claude Fable 5.1. It leads the September 2026 ranking with a score of 83, ahead of Claude Fable 5 (82.6) and Claude Opus 5 (82.4). Each row uses the public BenchAlign v5 contract and shows its evidence status.

Citable stat 230 AI models are ranked as of September 2, 2026; Claude Fable 5.1 leads at 83/100.

Operator review

What the ranking says today

I would start a broad evaluation with Claude Fable 5.1, Claude Fable 5, and Claude Opus 5. They are the first three rows under the same public scoring contract; the order is a shortlist, not a purchase order.

Operator receipt. I regenerated the active artifact against the reviewed 283-model registry on July 15, 2026. The public lane has been rebuilt on every data refresh since; as of September 2, 2026 it contains 230 eligible rows, led by Claude Fable 5.1 at 83.

Honest limit. BenchAlign v5 projects a common score from uneven public evidence. An “estimated” badge and a wide interval mean the row is useful for discovery but weak evidence for a close call. Replay the finalists on your own tasks, latency budget, and safety constraints.

Operator review by Glevd

About this ranking

Last verified: September 2, 2026

BenchLM.ai now distinguishes provisional overall ranking from verified overall ranking. The provisional score is a normalized weighted average across 8 benchmark categories: agentic (22%), coding (20%), reasoning (17%), knowledge (12%), multimodal & grounded (12%), multilingual (7%), instruction following (5%), and math (5%), using non-generated benchmark coverage plus bounded external consensus calibration. The verified leaderboard is stricter and only counts sourced benchmark rows. Each score includes a confidence indicator (1-4 dots) based on how much sourced coverage supports it. Display-only benchmarks — including MMLU, OpenBookQA, HumanEval, FLTEval, BBH, LisanBench, and older AIME/HMMT variants — remain visible for context but do not affect ranking.

This is the public BenchAlign v5 overall lane. Scores combine the approved agentic and coding projections; evidence labels distinguish supported rows from estimates.

The active lane starts with Claude Fable 5.1, followed by Claude Fable 5 and Claude Opus 5. All rows use the same BenchAlign v5 projection contract. Evidence badges matter as much as small point gaps because the public source coverage is uneven.

Open-weight and proprietary models share this lane, but deployment terms, latency, and operating cost are not part of the BenchAlign score. Use the ranking to choose a test set, then compare the finalists under the constraints that will exist in production.

This ranking uses the public BenchAlign v5 overall contract. For detailed model profiles, click any model name below. To compare two specific models head-to-head, use the "vs #" links.

What changed

Claude Fable 5.1 leads the live overall ranking at 83 with Estimated evidence.

Claude Fable 5 ranks #2 at 82.6 with Supported evidence.

Claude Opus 5 ranks #3 at 82.4 with Supported evidence.

How to choose

Full Rankings (230 models)

1
Claude Fable 5.1
Anthropic·Proprietary·1M

83

BenchAlign v5

Estimated

90% interval 71.44–94.46

2
Claude Fable 5
Anthropic·Proprietary·1M+

82.6

BenchAlign v5

Supported

90% interval 80.39–84.80

3
Claude Opus 5
Anthropic·Proprietary·

82.4

BenchAlign v5

Supported

90% interval 79.32–85.55

4
GPT-5.6 Sol
OpenAI·Proprietary·1.05M

81.8

BenchAlign v5

Supported

90% interval 79.14–84.55

5
Kimi K3
Moonshot AI·Pending·1.05M

80

BenchAlign v5

Supported

90% interval 77.80–82.24

6
Qwen3.8 Max
Alibaba·Open Weight·1M

78.7

BenchAlign v5

Supported

90% interval 76.51–80.80

7
Hy4 preview
Tencent·Open Weight·1M

78.3

BenchAlign v5

Estimated

90% interval 68.45–88.19

8
Muse Spark 1.2
Meta·Proprietary·1M

76.8

BenchAlign v5

Estimated

90% interval 65.29–88.31

9
Muse Spark 1.1
Meta·Proprietary·1M

76.7

BenchAlign v5

Supported

90% interval 71.88–81.52

10
Claude Opus 4.8
Anthropic·Proprietary·1M

76.1

BenchAlign v5

Supported

90% interval 73.68–78.59

11
Gemini 3.8 Flash
Google·Proprietary·1M

75.4

BenchAlign v5

Estimated

90% interval 63.85–86.88

12
Gemini 3.7 Flash
Google·Proprietary·1M

75.3

BenchAlign v5

Estimated

90% interval 63.75–86.78

13
Grok 4.6
xAI·Proprietary·500K

75.2

BenchAlign v5

Estimated

90% interval 63.66–86.69

14
Gemini 3.6 Flash
Google·Proprietary·1M

75.2

BenchAlign v5

Supported

90% interval 69.99–80.34

15
Grok 4.5
xAI·Proprietary·500K

75.1

BenchAlign v5

Supported

90% interval 70.54–79.61

16
GPT-5.5
OpenAI·Proprietary·1M

73.3

BenchAlign v5

Estimated

90% interval 64.77–81.76

17
GPT-5.4
OpenAI·Proprietary·1.05M

73.2

BenchAlign v5

Supported

90% interval 69.68–76.65

18
GPT-5.6 Terra
OpenAI·Proprietary·1.05M

72.6

BenchAlign v5

Estimated

90% interval 63.41–81.84

19
Claude Opus 4.7
Anthropic·Proprietary·1M

72.5

BenchAlign v5

Supported

90% interval 60.52–84.38

20
Claude Opus 4.7 (Adaptive)
Anthropic·Proprietary·1M

72.1

BenchAlign v5

Estimated

90% interval 62.21–81.95

21
Qwen3.8-27B
Alibaba·Open Weight·262K

72

BenchAlign v5

Supported

90% interval 69.78–74.15

22
Qwen3.7 Max
Alibaba·Proprietary·1M

71.4

BenchAlign v5

Supported

90% interval 63.62–79.18

23
Muse Spark
Meta·Proprietary·262K

70.7

BenchAlign v5

Supported

90% interval 60.63–80.81

24
MiMo-V2.5-Pro
Xiaomi·Proprietary·1M

69.1

BenchAlign v5

Supported

90% interval 59.52–78.60

25
dots3-note Preview
Dots Studio·Open Weight·512K

68.7

BenchAlign v5

Estimated

90% interval 58.80–78.54

26
MiniMax M3
MiniMax·Open Weight·1M

68.5

BenchAlign v5

Supported

90% interval 62.55–74.34

27
Claude Opus 4.6
Anthropic·Proprietary·1M

68

BenchAlign v5

Supported

90% interval 53.91–82.17

28
Hy3
Tencent·Open Weight·256K

67.8

BenchAlign v5

Supported

90% interval 58.82–76.68

29
GPT-5.2 Pro
OpenAI·Proprietary·400K

67.4

BenchAlign v5

Supported

90% interval 57.08–77.74

30
Ornith-1.5-397B
Ornith AI·Open Weight·262K

67.4

BenchAlign v5

Estimated

90% interval 57.52–77.26

31
Gemini 3 Pro
Google·Proprietary·2M

67.4

BenchAlign v5

Supported

90% interval 55.22–79.55

32
GPT-5.6 Luna
OpenAI·Proprietary·1.05M

67.1

BenchAlign v5

Estimated

90% interval 57.47–76.65

33
GLM-5.3
Z.AI·Open Weight·1M

67

BenchAlign v5

Estimated

90% interval 55.49–78.52

34
GLM-5.2
Z.AI·Open Weight·1M

66.9

BenchAlign v5

Estimated

90% interval 52.78–81.03

35
GLM-5.1
Z.AI·Open Weight·203K

66.8

BenchAlign v5

Supported

90% interval 55.94–77.67

36
MiMo-V2-Pro
Xiaomi·Proprietary·1M

66.8

BenchAlign v5

Supported

90% interval 57.86–75.68

37
Inkling
Thinking Machines Lab·Open Weight·1M

66.7

BenchAlign v5

Supported

90% interval 59.06–74.26

38
GPT-5.4 nano
OpenAI·Proprietary·400K

66.5

BenchAlign v5

Supported

90% interval 55.11–77.93

39
GLM-5-Turbo
Z.AI·Proprietary·200K

66

BenchAlign v5

Supported

90% interval 54.93–76.98

40
GPT-5.3 Codex
OpenAI·Proprietary·400K

65.7

BenchAlign v5

Supported

90% interval 61.52–69.93

41
Qwen3.7 Plus
Alibaba·Proprietary·1M

65.7

BenchAlign v5

Supported

90% interval 54.89–76.46

42
GLM-5
Z.AI·Open Weight·200K

65.6

BenchAlign v5

Supported

90% interval 53.85–77.43

43
Claude Opus 4.6 (Adaptive)
Anthropic·Proprietary·1M

65.3

BenchAlign v5

Estimated

90% interval 53.76–76.78

44
Gemini 3.5 Flash-Lite
Google·Proprietary·1M

65.1

BenchAlign v5

Supported

90% interval 52.93–77.30

45
Claude Sonnet 5
Anthropic·Proprietary·1M

64.9

BenchAlign v5

Estimated

90% interval 51.46–78.34

46
Qwen3.6 Plus
Alibaba·Proprietary·1M

64.7

BenchAlign v5

Supported

90% interval 54.95–74.46

47
Claude Sonnet 4.6
Anthropic·Proprietary·200K

64.7

BenchAlign v5

Supported

90% interval 51.13–78.18

48
GPT-5.5 Pro
OpenAI·Proprietary·1M

64.6

BenchAlign v5

Estimated

90% interval 50.13–79.02

49
Gemini 3.5 Flash
Google·Proprietary·1M

64.3

BenchAlign v5

Estimated

90% interval 54.38–74.26

50
Grok 4.3
xAI·Proprietary·1M

64

BenchAlign v5

Supported

90% interval 52.95–75.00

51
Claude Opus 4.5
Anthropic·Proprietary·200K

63.7

BenchAlign v5

Supported

90% interval 49.17–78.13

52
Inkling-Small
Thinking Machines Lab·Open Weight·1M

63.6

BenchAlign v5

Supported

90% interval 57.95–69.23

53
MiniMax M2.7
MiniMax·Open Weight·200K

62.9

BenchAlign v5

Supported

90% interval 55.03–70.83

54
MiMo-V2.5
Xiaomi·Proprietary·1M

62.4

BenchAlign v5

Estimated

90% interval 50.86–73.89

55
Gemini 3 Pro Deep Think
Google·Proprietary·2M

62.3

BenchAlign v5

Estimated

90% interval 50.83–73.85

56
MiMo-V2-Omni
Xiaomi·Proprietary·262K

62.3

BenchAlign v5

Supported

90% interval 51.27–73.28

57
GLM-5V-Turbo
Z.AI·Proprietary·200K

62.2

BenchAlign v5

Supported

90% interval 50.60–73.81

58
GPT-5.4 Pro
OpenAI·Proprietary·1.05M

61.7

BenchAlign v5

Estimated

90% interval 44.77–78.63

59
GLM-5.3-Flash
Z.AI·Open Weight·1M

61.7

BenchAlign v5

Estimated

90% interval 50.16–73.18

60
DeepSeek V4 Pro 0813
DeepSeek·Proprietary·1M

61.2

BenchAlign v5

Estimated

90% interval 51.36–71.10

61
Agents-A1
InternScience·Open Weight·262K

61.2

BenchAlign v5

Estimated

90% interval 51.35–71.09

62
Agents-A1-F16-GGUF
InternScience·Open Weight·262K

61.2

BenchAlign v5

Estimated

90% interval 51.35–71.09

63
Agents-A1-FP8
InternScience·Open Weight·262K

61.2

BenchAlign v5

Estimated

90% interval 51.35–71.09

64
Agents-A1-Q4_K_M-GGUF
InternScience·Open Weight·262K

61.2

BenchAlign v5

Estimated

90% interval 51.35–71.09

65
Agents-A1-Q8_0-GGUF
InternScience·Open Weight·262K

61.2

BenchAlign v5

Estimated

90% interval 51.35–71.09

66
Grok 4.20
xAI·Proprietary·2M

61.1

BenchAlign v5

Estimated

90% interval 44.15–77.97

67
Qwen3.8-Flash-Next
Alibaba·Open Weight·262K

61.1

BenchAlign v5

Estimated

90% interval 49.54–72.57

68
Grok 4.1
xAI·Proprietary·1M

61

BenchAlign v5

Estimated

90% interval 49.45–72.48

69
GLM-5 (Reasoning)
Z.AI·Open Weight·200K

60.8

BenchAlign v5

Estimated

90% interval 49.27–72.30

70
GLM-4.7
Z.AI·Open Weight·200K

60.8

BenchAlign v5

Supported

90% interval 46.31–75.23

71
Qwen3.5 397B (Reasoning)
Alibaba·Open Weight·128K

60.5

BenchAlign v5

Estimated

90% interval 48.99–72.02

72
Qwen 3.6 Max (preview)
Alibaba·Proprietary·256K

60.4

BenchAlign v5

Supported

90% interval 41.34–79.50

73
Kimi K2.5 (Reasoning)
Moonshot AI·Proprietary·128K

60.4

BenchAlign v5

Estimated

90% interval 48.84–71.87

74
Gemma 4 31B
Google·Open Weight·256K

60.2

BenchAlign v5

Supported

90% interval 43.39–77.07

75
GPT-5.2 Instant
OpenAI·Proprietary·128K

60

BenchAlign v5

Estimated

90% interval 48.49–71.52

76
GPT-5.3 Instant
OpenAI·Proprietary·400K

59.9

BenchAlign v5

Estimated

90% interval 48.39–71.41

77
Gemini 3 Flash
Google·Proprietary·1M

59.9

BenchAlign v5

Supported

90% interval 40.02–79.76

78
Qwen3.5-27B
Alibaba·Open Weight·262K

59.8

BenchAlign v5

Supported

90% interval 49.81–69.87

79
Grok 4.1 Fast (Reasoning)
xAI·Proprietary·2M

59.7

BenchAlign v5

Supported

90% interval 45.67–73.71

80
GPT-5 (high)
OpenAI·Proprietary·128K

59.6

BenchAlign v5

Estimated

90% interval 48.11–71.14

81
Qwen3.5-122B-A10B
Alibaba·Open Weight·262K

59.6

BenchAlign v5

Supported

90% interval 47.69–71.54

82
Grok 4
xAI·Proprietary·128K

59.6

BenchAlign v5

Supported

90% interval 48.84–70.28

83
Kimi K2.7 Code
Moonshot AI·Open Weight·256K

59.3

BenchAlign v5

Estimated

90% interval 48.33–70.24

84
Kimi K2.6
Moonshot AI·Open Weight·256K

59.2

BenchAlign v5

Estimated

90% interval 49.31–69.05

85
DeepSeek V3.2 (Thinking)
DeepSeek·Open Weight·128K

59.1

BenchAlign v5

Estimated

90% interval 47.61–70.63

86
Qwen3 235B 2507 (Reasoning)
Alibaba·Open Weight·128K

59

BenchAlign v5

Estimated

90% interval 47.49–70.52

87
Kimi K2.5
Moonshot AI·Open Weight·256K

58.9

BenchAlign v5

Supported

90% interval 50.17–67.57

88
MiniMax M2.5
MiniMax·Proprietary·128K

58.6

BenchAlign v5

Supported

90% interval 49.94–67.32

89
GLM-4.5
Z.AI·Proprietary·128K

58.6

BenchAlign v5

Estimated

90% interval 47.04–70.07

90
GPT-5.2
OpenAI·Proprietary·400K

58.1

BenchAlign v5

Estimated

90% interval 50.09–66.08

91
Qwen3.5 397B
Alibaba·Open Weight·128K

58

BenchAlign v5

Estimated

90% interval 46.47–69.50

92
GPT-5.2-Codex
OpenAI·Proprietary·400K

58

BenchAlign v5

Supported

90% interval 54.89–61.08

93
GPT-5.3-Codex-Spark
OpenAI·Proprietary·256K

57.9

BenchAlign v5

Estimated

90% interval 46.37–69.40

94
Claude Haiku 4.5
Anthropic·Proprietary·200K

57.6

BenchAlign v5

Estimated

90% interval 46.07–69.10

95
Claude Opus 4.5 Thinking
Anthropic·Proprietary·200K

57.4

BenchAlign v5

Estimated

90% interval 45.90–68.93

96
Gemma 4 26B A4B
Google·Open Weight·256K

57.3

BenchAlign v5

Supported

90% interval 39.11–75.40

97
Qwen3 235B 2507
Alibaba·Open Weight·128K

57

BenchAlign v5

Estimated

90% interval 45.46–68.49

98
Gemini 2.5 Pro
Google·Proprietary·1M

56.9

BenchAlign v5

Supported

90% interval 38.45–75.42

99
Trinity-Large-Preview
Arcee AI·Open Weight·512K

56.9

BenchAlign v5

Estimated

90% interval 45.38–68.41

100
GPT-5.4 mini
OpenAI·Proprietary·400K

56.9

BenchAlign v5

Estimated

90% interval 45.34–68.37

101
Gemini 3.1 Pro
Google·Proprietary·1M

56.4

BenchAlign v5

Estimated

90% interval 40.39–72.48

102
Apodex 1.1
Apodex·Proprietary·N/A

56.3

BenchAlign v5

Estimated

90% interval 44.76–67.79

103
Qwen3.5-35B-A3B
Alibaba·Open Weight·262K

56.2

BenchAlign v5

Supported

90% interval 44.18–68.29

104
Grok 4 Fast (Reasoning)
xAI·Proprietary·2M

55.9

BenchAlign v5

Supported

90% interval 41.80–70.02

105
DeepSeek LLM 2.0
DeepSeek·Open Weight·128K

55.5

BenchAlign v5

Estimated

90% interval 43.95–66.98

106
GPT-5.1-Codex-Max
OpenAI·Proprietary·400K

55.4

BenchAlign v5

Estimated

90% interval 43.90–66.93

107
DeepSeek V3.2
DeepSeek·Open Weight·128K

54.8

BenchAlign v5

Supported

90% interval 37.10–72.47

108
Claude Sonnet 4.5
Anthropic·Proprietary·200K

54.7

BenchAlign v5

Estimated

90% interval 43.19–66.22

109
GLM-4.6
Z.AI·Open Weight·200K

54.5

BenchAlign v5

Supported

90% interval 35.71–73.30

110
Step 3.7 Flash
StepFun·Open Weight·256K

54.5

BenchAlign v5

Estimated

90% interval 42.94–65.97

111
Step 3.5 Flash
StepFun·Open Weight·256K

54.4

BenchAlign v5

Supported

90% interval 40.15–68.56

112
GPT-5 (medium)
OpenAI·Proprietary·128K

54.2

BenchAlign v5

Supported

90% interval 49.92–58.47

113
Nemotron 3 Nano 30B
NVIDIA·Open Weight·32K

53.9

BenchAlign v5

Estimated

90% interval 42.35–65.37

114
Ling 3.0 Flash
InclusionAI·Open Weight·262K

53.8

BenchAlign v5

Estimated

90% interval 42.27–65.30

115
Qwen3.6-27B
Alibaba·Open Weight·262K

53.7

BenchAlign v5

Estimated

90% interval 42.22–65.25

116
GPT-5.1
OpenAI·Proprietary·200K

53.6

BenchAlign v5

Estimated

90% interval 42.07–65.10

117
MiMo-V2-Flash
Xiaomi·Open Weight·256K

53.4

BenchAlign v5

Supported

90% interval 38.35–68.44

118
Ornith-1.5-35B-A3B
Ornith AI·Open Weight·262K

53.4

BenchAlign v5

Estimated

90% interval 43.50–63.24

119
DeepSeek V3.1
DeepSeek·Open Weight·128K

53.1

BenchAlign v5

Supported

90% interval 33.58–72.58

120
Qwen2.5-72B
Alibaba·Open Weight·128K

53.1

BenchAlign v5

Estimated

90% interval 41.54–64.57

121
DeepSeek V3.1 (Reasoning)
DeepSeek·Open Weight·128K

52.9

BenchAlign v5

Supported

90% interval 33.10–72.69

122
GPT-5.1-Codex
OpenAI·Proprietary·400K

52.8

BenchAlign v5

Estimated

90% interval 41.29–64.32

123
Llama 3.1 405B
Meta·Open Weight·128K

52.6

BenchAlign v5

Estimated

90% interval 41.09–64.12

124
Nemotron 3 Super 120B A12B
NVIDIA·Open Weight·256K

51.9

BenchAlign v5

Estimated

90% interval 40.34–63.37

125
Llama 3 70B
Meta·Open Weight·128K

51.7

BenchAlign v5

Estimated

90% interval 40.19–63.22

126
Qwen3.6-35B-A3B
Alibaba·Open Weight·262K

51.5

BenchAlign v5

Estimated

90% interval 39.98–63.01

127
DeepSeek Coder 2.0
DeepSeek·Open Weight·128K

51.2

BenchAlign v5

Estimated

90% interval 39.64–62.67

128
DeepSeek-R1
DeepSeek·Open Weight·128K

51.1

BenchAlign v5

Supported

90% interval 32.58–69.66

129
Seed 1.6
ByteDance·Proprietary·256K

51.1

BenchAlign v5

Estimated

90% interval 39.59–62.62

130
Gemini 3.1 Flash-Lite
Google·Proprietary·1M

51

BenchAlign v5

Supported

90% interval 24.75–77.27

131
GPT-4.1
OpenAI·Proprietary·1M

51

BenchAlign v5

Supported

90% interval 30.60–71.37

132
Nemotron 3 Super 100B
NVIDIA·Open Weight·1M

51

BenchAlign v5

Estimated

90% interval 39.44–62.47

133
o4-mini (high)
OpenAI·Proprietary·200K

50.8

BenchAlign v5

Estimated

90% interval 39.33–62.35

134
Grok 4.1 Fast
xAI·Proprietary·1M

50.8

BenchAlign v5

Supported

90% interval 28.17–73.46

135
DeepSeekMath V2
DeepSeek·Open Weight·128K

50.8

BenchAlign v5

Estimated

90% interval 39.24–62.27

136
Qwen2.5-1M
Alibaba·Open Weight·1M

50.8

BenchAlign v5

Estimated

90% interval 39.24–62.27

137
Seed-2.0-Lite
ByteDance·Proprietary·256K

50.7

BenchAlign v5

Estimated

90% interval 39.19–62.22

138
MAI-Thinking-1
Microsoft·Proprietary·256K

50.6

BenchAlign v5

Estimated

90% interval 40.71–60.45

139
GLM-4.7-Flash
Z.AI·Open Weight·200K

50.5

BenchAlign v5

Supported

90% interval 36.49–64.52

140
Ornith-1.5-9B
Ornith AI·Open Weight·262K

50.2

BenchAlign v5

Estimated

90% interval 40.37–60.11

141
Ministral 3 14B (Reasoning)
Mistral·Open Weight·128K

50.2

BenchAlign v5

Estimated

90% interval 38.69–61.72

142
Mistral Large 3
Mistral·Proprietary·128K

49.7

BenchAlign v5

Supported

90% interval 26.97–72.47

143
Aion-2.0
Aion Labs·Proprietary·128K

49.5

BenchAlign v5

Estimated

90% interval 38.00–61.02

144
Mixtral 8x22B Instruct v0.1
Mistral·Open Weight·64K

49.4

BenchAlign v5

Estimated

90% interval 37.90–60.92

145
GPT-OSS 120B
OpenAI·Open Weight·128K

49.4

BenchAlign v5

Supported

90% interval 36.14–62.60

146
o1
OpenAI·Proprietary·200K

48.7

BenchAlign v5

Estimated

90% interval 37.22–60.24

147
o1-preview
OpenAI·Proprietary·200K

48.6

BenchAlign v5

Supported

90% interval 28.83–68.43

148
Claude 3.5 Sonnet
Anthropic·Proprietary·200K

48.6

BenchAlign v5

Estimated

90% interval 37.06–60.09

149
Qwen3 Max
Alibaba·Proprietary·1M

48.4

BenchAlign v5

Estimated

90% interval 36.91–59.94

150
Mercury 2
Inception·Proprietary·128K

48.3

BenchAlign v5

Supported

90% interval 35.01–61.56

151
Trinity-Large-Thinking
Arcee AI·Open Weight·512K

48.1

BenchAlign v5

Supported

90% interval 30.81–65.33

152
Qwen3.5 Plus
Alibaba·Proprietary·1M

48

BenchAlign v5

Estimated

90% interval 33.99–61.98

153
Command A+
Cohere·Open Weight·128K

47.8

BenchAlign v5

Estimated

90% interval 36.24–59.27

154
Qwen3.5 Flash
Alibaba·Proprietary·1M

47.7

BenchAlign v5

Supported

90% interval 24.68–70.81

155
Gemini 2.5 Flash
Google·Proprietary·1M

47.7

BenchAlign v5

Supported

90% interval 24.49–70.96

156
K-Exaone
LG AI Research·Proprietary·256K

47.6

BenchAlign v5

Estimated

90% interval 36.12–59.15

157
Gemma 4 12B
Google·Open Weight·256K

47.5

BenchAlign v5

Estimated

90% interval 36.00–59.03

158
o3-pro
OpenAI·Proprietary·200K

47.3

BenchAlign v5

Supported

90% interval 43.01–51.61

159
GLM-4.5-Air
Z.AI·Proprietary·128K

47.2

BenchAlign v5

Supported

90% interval 28.33–66.15

160
o3
OpenAI·Proprietary·200K

46.9

BenchAlign v5

Supported

90% interval 44.01–49.88

161
o3-mini
OpenAI·Proprietary·200K

46.8

BenchAlign v5

Supported

90% interval 31.73–61.96

162
GPT-5 nano
OpenAI·Proprietary·400K

46.7

BenchAlign v5

Estimated

90% interval 35.20–58.22

163
Mistral Small 4
Mistral·Open Weight·256K

46.5

BenchAlign v5

Estimated

90% interval 35.02–58.05

164
o1-pro
OpenAI·Proprietary·200K

46.3

BenchAlign v5

Estimated

90% interval 34.79–57.82

165
Z-1
Z·Proprietary·128K

45.9

BenchAlign v5

Estimated

90% interval 34.42–57.45

166
Nemotron-4 15B
NVIDIA·Open Weight·32K

45.9

BenchAlign v5

Estimated

90% interval 34.37–57.40

167
Seed 1.6 Flash
ByteDance·Proprietary·256K

45.9

BenchAlign v5

Estimated

90% interval 34.37–57.40

168
Mistral 8x7B
Mistral·Open Weight·32K

45.8

BenchAlign v5

Estimated

90% interval 34.28–57.30

169
Nemotron 3 Ultra
NVIDIA·Open Weight·1M

45.7

BenchAlign v5

Estimated

90% interval 35.84–55.58

170
Moonshot v1
Moonshot AI·Proprietary·128K

45.6

BenchAlign v5

Estimated

90% interval 34.08–57.11

171
Seed-2.0-Mini
ByteDance·Proprietary·256K

45.4

BenchAlign v5

Estimated

90% interval 33.88–56.91

172
Nemotron Ultra 253B
NVIDIA·Open Weight·32K

45.2

BenchAlign v5

Estimated

90% interval 33.68–56.71

173
Claude 4.1 Opus
Anthropic·Proprietary·200K

45.1

BenchAlign v5

Supported

90% interval 42.12–48.16

174
Nemotron 3 Nano Omni 30B A3B
NVIDIA·Open Weight·256K

44.7

BenchAlign v5

Estimated

90% interval 33.16–56.19

175
GPT-4.1 mini
OpenAI·Proprietary·1M

44.6

BenchAlign v5

Estimated

90% interval 33.07–56.10

176
DeepSeek V3
DeepSeek·Open Weight·128K

44.5

BenchAlign v5

Supported

90% interval 25.28–63.79

177
Ling 2.6 Flash
InclusionAI·Open Weight·262K

44.4

BenchAlign v5

Estimated

90% interval 32.85–55.88

178
Hy3 Preview
Tencent·Open Weight·256K

43.8

BenchAlign v5

Estimated

90% interval 33.88–53.62

179
Mistral Medium 3
Mistral·Proprietary·128K

43.7

BenchAlign v5

Estimated

90% interval 32.17–55.19

180
Gemma 4 E4B
Google·Open Weight·128K

43.6

BenchAlign v5

Estimated

90% interval 32.05–55.08

181
Sarvam 105B
Sarvam·Open Weight·128K

43.5

BenchAlign v5

Estimated

90% interval 31.94–54.97

182
GPT-5 mini
OpenAI·Proprietary·128K

43.1

BenchAlign v5

Supported

90% interval 39.62–46.57

183
LFM2.5-2.6B
LiquidAI·Open Weight·128K

43.1

BenchAlign v5

Estimated

90% interval 31.58–54.61

184
DeepSeek R1 Distill Qwen 32B
DeepSeek·Open Weight·128K

43.1

BenchAlign v5

Estimated

90% interval 31.57–54.60

185
Granite 4.2 8B
IBM·Open Weight·128K

42.8

BenchAlign v5

Supported

90% interval 32.82–52.83

186
GPT-4.1 nano
OpenAI·Proprietary·1M

42.6

BenchAlign v5

Estimated

90% interval 31.05–54.08

187
Gemma 4 E2B
Google·Open Weight·128K

42.5

BenchAlign v5

Estimated

90% interval 31.01–54.04

188
GPT-OSS 20B
OpenAI·Open Weight·128K

42.4

BenchAlign v5

Supported

90% interval 27.20–57.61

189
Mistral Large 2
Mistral·Proprietary·128K

42.3

BenchAlign v5

Estimated

90% interval 30.80–53.83

190
Claude 4 Sonnet
Anthropic·Proprietary·200K

42.2

BenchAlign v5

Supported

90% interval 38.89–45.43

191
LFM2.5-8B-A1B
LiquidAI·Open Weight·128K

42

BenchAlign v5

Estimated

90% interval 30.46–53.49

192
Solar Pro 2
Upstage·Proprietary·128K

41.8

BenchAlign v5

Estimated

90% interval 30.24–53.27

193
Gemma 3 27B
Google·Open Weight·32K

41.4

BenchAlign v5

Supported

90% interval 17.07–65.77

194
Sarvam 30B
Sarvam·Open Weight·64K

41.3

BenchAlign v5

Estimated

90% interval 29.78–52.81

195
Ministral 3 8B (Reasoning)
Mistral·Open Weight·128K

41.1

BenchAlign v5

Estimated

90% interval 29.62–52.65

196
GPT-4o
OpenAI·Proprietary·128K

41.1

BenchAlign v5

Supported

90% interval 21.67–60.56

197
Exaone 4.0 32B
LG AI Research·Open Weight·128K

41

BenchAlign v5

Estimated

90% interval 29.52–52.55

198
Claude 3 Opus
Anthropic·Proprietary·200K

40.7

BenchAlign v5

Supported

90% interval 22.85–58.60

199
Mistral 7B v0.3
Mistral·Open Weight·32K

40.7

BenchAlign v5

Estimated

90% interval 29.13–52.16

200
Qwen2.5-VL-32B
Alibaba·Open Weight·32K

40.6

BenchAlign v5

Estimated

90% interval 29.09–52.11

201
Llama 4 Behemoth
Meta·Open Weight·32K

40.6

BenchAlign v5

Estimated

90% interval 29.04–52.07

202
Grok 3 [Beta]
xAI·Proprietary·128K

40.5

BenchAlign v5

Supported

90% interval 8.75–72.23

203
Ministral 3 3B (Reasoning)
Mistral·Open Weight·128K

40.3

BenchAlign v5

Estimated

90% interval 28.75–51.77

204
Mistral 8x7B v0.2
Mistral·Open Weight·32K

39.9

BenchAlign v5

Estimated

90% interval 28.36–51.39

205
Exaone 4.0 1.2B
LG AI Research·Open Weight·128K

39.7

BenchAlign v5

Estimated

90% interval 28.21–51.24

206
Llama 4 Scout
Meta·Open Weight·10M

39.7

BenchAlign v5

Supported

90% interval 20.78–58.62

207
Granite-4.0-350M
IBM·Open Weight·32K

39.2

BenchAlign v5

Estimated

90% interval 27.68–50.71

208
Granite-4.0-H-350M
IBM·Open Weight·32K

39.2

BenchAlign v5

Estimated

90% interval 27.68–50.71

209
Grok Code Fast 1
xAI·Proprietary·256K

37.9

BenchAlign v5

Supported

90% interval 34.81–40.89

210
GPT-4o mini
OpenAI·Proprietary·128K

37.6

BenchAlign v5

Supported

90% interval 16.77–58.41

211
Claude 4.1 Opus Thinking
Anthropic·Proprietary·200K

35.4

BenchAlign v5

Supported

90% interval 16.38–54.32

212
Gemini 1.5 Pro
Google·Proprietary·2M

35.3

BenchAlign v5

Supported

90% interval 21.18–49.39

213
Qwen2.5 Coder 32B Instruct
Alibaba·Open Weight·128K

34.4

BenchAlign v5

Supported

90% interval 17.63–51.09

214
Ministral 3 14B
Mistral·Open Weight·128K

34.2

BenchAlign v5

Supported

90% interval 23.10–45.19

215
ZAYA1-8B
Zyphra·Open Weight·131K

31.2

BenchAlign v5

Estimated

90% interval 21.35–41.09

216
GPT-4 Turbo
OpenAI·Proprietary·128K

27

BenchAlign v5

Supported

90% interval 19.44–34.52

217

26.6

BenchAlign v5

Estimated

90% interval 16.73–36.46

218
Kimi K2
Moonshot AI·Proprietary·128K

26.3

BenchAlign v5

Supported

90% interval 16.16–36.52

219
MiniMax M1 80k
MiniMax·Proprietary·80K

24.3

BenchAlign v5

Supported

90% interval 14.42–34.21

220
Llama 4 Maverick
Meta·Open Weight·1M

22.9

BenchAlign v5

Supported

90% interval 15.29–30.43

221
Phi-4
Microsoft·Open Weight·16K

22.7

BenchAlign v5

Supported

90% interval 0.00–45.80

222
Gemini 1.0 Pro
Google·Proprietary·32K

21.4

BenchAlign v5

Supported

90% interval 13.93–28.89

223
Claude 3 Haiku
Anthropic·Proprietary·200K

21

BenchAlign v5

Supported

90% interval 14.84–27.14

224
Ministral 3 8B
Mistral·Open Weight·128K

20.5

BenchAlign v5

Supported

90% interval 16.80–24.18

225
Nova Pro
Amazon·Proprietary·128K

19.8

BenchAlign v5

Supported

90% interval 16.67–22.90

226
LFM2-24B-A2B
LiquidAI·Proprietary·32K

18.4

BenchAlign v5

Supported

90% interval 15.35–21.47

227
Ministral 3 3B
Mistral·Open Weight·128K

18

BenchAlign v5

Supported

90% interval 14.11–21.97

228
LFM2.5-1.2B-Thinking
LiquidAI·Proprietary·32K

15.8

BenchAlign v5

Supported

90% interval 12.78–18.87

229
LFM2.5-1.2B-Instruct
LiquidAI·Proprietary·32K

15.1

BenchAlign v5

Supported

90% interval 12.20–18.02

230
MiniCPM5-1B
OpenBMB·Open Weight·131K

11.1

BenchAlign v5

Estimated

90% interval 1.26–21.00

Key Takeaways

The top model is Claude Fable 5.1 by Anthropic with a BenchAlign v5 score of 83 and Estimated evidence.

The best open-weight model is Qwen3.8 Max at position #6.

230 models are included in this ranking.

Score in Context

What these scores mean

The overall score is a weighted average across 8 benchmark categories. Agentic (22%), coding (20%), and reasoning (17%) carry the most weight. A 5-point gap in overall score is meaningful — it reflects consistent performance differences across multiple domains.

Known limitations

The overall score compresses 8 categories into one number. Two models with the same overall score can have very different strengths — one might lead coding while the other leads reasoning. Always check category scores for your specific use case.

Best AI Models Overall FAQ

What is the best AI model right now?

The model in the #1 row of the leaderboard above is the best AI model right now on BenchLM’s weighted rankings — the answer box at the top of this page names it with its current score. Rankings are recomputed on every data refresh across agentic, coding, reasoning, knowledge, multimodal, multilingual, instruction-following, and math benchmarks, so the leader can change as new models ship.

What is the smartest AI model?

"Smartest" depends on the yardstick. For raw reasoning and knowledge, check the reasoning and knowledge category columns on the leaderboard above; for the broadest definition of capability, the overall #1 is the best single answer. Reasoning-class models typically lead on hard-science benchmarks like GPQA Diamond and Humanity’s Last Exam, while non-reasoning models can still win on speed-sensitive everyday tasks.

What is the best LLM overall?

BenchLM ranks every tracked LLM by a weighted overall score — agentic work counts 22%, coding 20%, and reasoning 17%, with knowledge, multimodal, multilingual, instruction following, and math making up the rest. The current best LLM overall is the top row of this page’s leaderboard, with confidence dots showing how much sourced benchmark coverage supports its score.

How are these AI models ranked?

Each model’s overall score is a normalized weighted average across 8 benchmark categories, using non-generated benchmark coverage plus bounded external consensus calibration. A stricter verified leaderboard counts only sourced benchmark rows. Models without enough non-generated coverage are tracked but unranked, so a high position here reflects real, sourced evidence rather than a single headline benchmark.

Is the best AI model worth paying for?

Usually only for the slice of work where quality failures are expensive. The top-ranked models carry premium per-token prices, while models a few points lower often cost 2–5x less. Check the price-vs-performance view and the per-provider API pricing hubs to find the cheapest model that clears your quality bar, then route only high-stakes tasks to the leader.

Last updated: September 2, 2026

Know when it’s worth switching models

The model to choose, the cheaper alternative, and the release we would wait on.

Read a sample issue

Join 2,000+ readers.

One email each week. Unsubscribe anytime.