Skip to main content
Radar

Five or fewer confirmed AI changes, with original sources, on mornings when something changed.A free source-linked morning brief.

Start the free Radar Brief
BenchLM recommendation

Best LLMs for AI Agents in 2026

Data verified

As of August 27, 2026, the top model in best llms for ai agents on the BenchLM leaderboard is Claude Opus 5 with a score of 80.

Bottom line: Claude Mythos 5 and Claude Fable 5 lead agentic work, with GPT-5.5 the strongest non-Anthropic row. Agent harness quality matters as much as the model — test with your own scaffold.

About this ranking

Last verified: August 27, 2026

Agentic capability is BenchLM's heaviest-weighted category (22% of the overall score) because it is where models differ most in practice: tool calling, browsing, terminal work, and multi-step task execution. This page ranks models purely by their agentic category score, built from benchmarks like Terminal-Bench 2, BrowseComp, OSWorld-Verified, and tau2-bench.

Unless noted otherwise, ranking surfaces on this page use BenchLM’s provisional leaderboard lane rather than the stricter sourced-only verified leaderboard.

Claude Opus 5 leads this ranking with a score of 80, followed by Claude Mythos 5 (75.6) and Claude Fable 5 (75.4). There is meaningful separation between the top models, suggesting genuine performance differences.

The best open-weight option is Qwen3.8 Max (ranked #5 with a score of 73.2). While proprietary models lead, open-weight options are within striking distance for teams willing to trade a few points of performance for full model control.

This ranking uses provisional weighted averages across the scoring benchmarks in agentic. For detailed model profiles, click any model name below. To compare two specific models head-to-head, use the "vs #" links.

What changed

Claude Mythos 5 tops the agentic category with a perfect weighted score.

Claude Fable 5 within a point of the lead — the strongest generally available agentic model.

GPT-5.5 the best non-Anthropic agentic row at 96.1.

How to choose

Full Rankings (138 models)

1
Claude Opus 5
Anthropic·Proprietary·

80

BenchAlign v5

2
Claude Mythos 5
Anthropic·Proprietary·1M+

75.6

BenchAlign v5

3
Claude Fable 5
Anthropic·Proprietary·1M+

75.4

BenchAlign v5

4
Kimi K3
Moonshot AI·Pending·1.05M

74.3

BenchAlign v5

5
Qwen3.8 Max
Alibaba·Open Weight·1M

73.2

BenchAlign v5

6
Qwen3.8-27B
Alibaba·Open Weight·262K

70.2

BenchAlign v5

7
GPT-5.6 Sol
OpenAI·Proprietary·1.05M

68.3

BenchAlign v5

8
Grok 4.6
xAI·Proprietary·500K

66.5

BenchAlign v5

9
Claude Sonnet 5
Anthropic·Proprietary·1M

65.6

BenchAlign v5

10
Muse Spark
Meta·Proprietary·262K

65.2

BenchAlign v5

11
GPT-5.5
OpenAI·Proprietary·1M

64.7

BenchAlign v5

12
Claude Opus 4.7 (Adaptive)
Anthropic·Proprietary·1M

63.7

BenchAlign v5

13
Qwen3.8-Flash-Next
Alibaba·Open Weight·262K

62.7

BenchAlign v5

14
Ornith-1.5-397B
Ornith AI·Open Weight·262K

62.4

BenchAlign v5

15
Grok 4.5
xAI·Proprietary·500K

61.8

BenchAlign v5

16
Claude Opus 4.8
Anthropic·Proprietary·1M

61.2

BenchAlign v5

17
GPT-5.3 Codex
OpenAI·Proprietary·400K

61.2

BenchAlign v5

18
GPT-5.5 Pro
OpenAI·Proprietary·1M

61.2

BenchAlign v5

19
dots3-note Preview
Dots Studio·Open Weight·512K

61

BenchAlign v5

20
GLM-5.3
Z.AI·Proprietary·1M

60.8

BenchAlign v5

21
Muse Spark 1.1
Meta·Proprietary·1M

60.6

BenchAlign v5

22
GPT-5.4 Pro
OpenAI·Proprietary·1.05M

59.1

BenchAlign v5

23
Gemini 3 Pro
Google·Proprietary·2M

59

BenchAlign v5

24
Claude Opus 4.7
Anthropic·Proprietary·1M

58.8

BenchAlign v5

25
GPT-5.6 Terra
OpenAI·Proprietary·1.05M

58.6

BenchAlign v5

26
Claude Opus 4.6
Anthropic·Proprietary·1M

58.3

BenchAlign v5

27
Gemini 3.7 Flash
Google·Pending·

58.2

BenchAlign v5

28
Qwen 3.6 Max (preview)
Alibaba·Proprietary·256K

58

BenchAlign v5

29
Claude Opus 4.6 (Adaptive)
Anthropic·Proprietary·1M

58

BenchAlign v5

30
GPT-5.4
OpenAI·Proprietary·1.05M

57.5

BenchAlign v5

31
DeepSeek V4 Pro 0813
DeepSeek·Proprietary·1M

57.4

BenchAlign v5

32
GLM-5.2
Z.AI·Open Weight·1M

57.4

BenchAlign v5

33
Muse Spark 1.2
Meta·Proprietary·1M

57.4

BenchAlign v5

34
Agents-A1
InternScience·Open Weight·262K

56.8

BenchAlign v5

35
Agents-A1-F16-GGUF
InternScience·Open Weight·262K

56.8

BenchAlign v5

36
Agents-A1-FP8
InternScience·Open Weight·262K

56.8

BenchAlign v5

37
Agents-A1-Q4_K_M-GGUF
InternScience·Open Weight·262K

56.8

BenchAlign v5

38
Agents-A1-Q8_0-GGUF
InternScience·Open Weight·262K

56.8

BenchAlign v5

39
SWE-1.7
Cognition·Proprietary·256K

55.2

BenchAlign v5

40
GLM-5
Z.AI·Open Weight·200K

55.1

BenchAlign v5

41
Holo3-35B-A3B
H Company·Open Weight·64K

54.7

BenchAlign v5

42
MiMo-V2.5
Xiaomi·Proprietary·1M

54.6

BenchAlign v5

43
Ornith-1.0-397B
DeepReinforce AI·Open Weight·256K

54.5

BenchAlign v5

44
Holo3-122B-A10B
H Company·Proprietary·64K

53.7

BenchAlign v5

45
GPT-5.2-Codex
OpenAI·Proprietary·400K

53.5

BenchAlign v5

46
Laguna S 2.1
Poolside·Open Weight·1M

53.4

BenchAlign v5

47
Composer 2.5
Cursor·Proprietary·200K

53.3

BenchAlign v5

48
BTL-4
Bad Theory Labs·Open Weight·262K

53.1

BenchAlign v5

49
GPT-5.6 Luna
OpenAI·Proprietary·1.05M

53.1

BenchAlign v5

50
Pokee-Isaac 28B
Pokee AI·Proprietary·10M

52.3

BenchAlign v5

51
Ornith-1.0-35B
DeepReinforce AI·Open Weight·256K

52.3

BenchAlign v5

52
Composer 2
Cursor·Proprietary·200K

52.1

BenchAlign v5

53
Muse Glimmer 30B
Meta·Open Weight·131K

51.8

BenchAlign v5

54
GPT-5.1-Codex
OpenAI·Proprietary·400K

51.7

BenchAlign v5

55
Claude Haiku 4.5
Anthropic·Proprietary·200K

51.4

BenchAlign v5

56
GLM-4.7
Z.AI·Open Weight·200K

51.2

BenchAlign v5

57
GPT-5 (high)
OpenAI·Proprietary·128K

51.1

BenchAlign v5

58
Claude Sonnet 4.6
Anthropic·Proprietary·200K

51

BenchAlign v5

59
Grok 4.20
xAI·Proprietary·2M

50.8

BenchAlign v5

60
MAI-Thinking-1
Microsoft·Proprietary·256K

50.4

BenchAlign v5

61
Kimi K2.5 (Reasoning)
Moonshot AI·Proprietary·128K

50.2

BenchAlign v5

62
Laguna M.1
Poolside·Proprietary·256K

49.7

BenchAlign v5

63
Gemma 4 26B A4B
Google·Open Weight·256K

49.2

BenchAlign v5

64
Ornith-1.5-35B-A3B
Ornith AI·Open Weight·262K

49.1

BenchAlign v5

65
Ling 3.0 Flash
InclusionAI·Open Weight·262K

49.1

BenchAlign v5

66
Ornith-1.0-9B
DeepReinforce AI·Open Weight·256K

49

BenchAlign v5

67
Qwen3.5 Plus
Alibaba·Proprietary·1M

49

BenchAlign v5

68
Qwen3.5-122B-A10B
Alibaba·Open Weight·262K

48.9

BenchAlign v5

69
GPT-5.1
OpenAI·Proprietary·200K

48.9

BenchAlign v5

70
Qwen3.5-27B
Alibaba·Open Weight·262K

48.9

BenchAlign v5

71
Laguna XS.2
Poolside·Open Weight·256K

48.1

BenchAlign v5

72
Mellum2-12B-A2.5B-Thinking
JetBrains·Open Weight·128K

47.9

BenchAlign v5

73
Gemini 2.5 Pro
Google·Proprietary·1M

47.9

BenchAlign v5

74
Qwen3.5 397B
Alibaba·Open Weight·128K

47.6

BenchAlign v5

75
Mellum2-12B-A2.5B-Instruct
JetBrains·Open Weight·128K

47.3

BenchAlign v5

76
Hy3 Preview
Tencent·Open Weight·256K

47.1

BenchAlign v5

77
Claude Sonnet 4.5
Anthropic·Proprietary·200K

46.7

BenchAlign v5

78
LFM2.5-8B-A1B
LiquidAI·Open Weight·128K

46.4

BenchAlign v5

79
GLM-5.1
Z.AI·Open Weight·203K

46.3

BenchAlign v5

80
Gemini 3.5 Flash
Google·Proprietary·1M

46.3

BenchAlign v5

81
Qwen3.5-35B-A3B
Alibaba·Open Weight·262K

45.7

BenchAlign v5

82
Mistral Medium 3.5 128B
Mistral·Open Weight·256K

45.5

BenchAlign v5

83
Claude 4.1 Opus
Anthropic·Proprietary·200K

45.5

BenchAlign v5

84
Step 3.7 Flash
StepFun·Open Weight·256K

45.5

BenchAlign v5

85
LFM2.5-230M
LiquidAI·Open Weight·32K

45.3

BenchAlign v5

86
LFM2.5-VL-450M
LiquidAI·Open Weight·128K

45.3

BenchAlign v5

87
Qwen3.6-35B-A3B
Alibaba·Open Weight·262K

45.1

BenchAlign v5

88
GPT-OSS 120B
OpenAI·Open Weight·128K

44.5

BenchAlign v5

89
Command A+
Cohere·Open Weight·128K

44.3

BenchAlign v5

90
GPT-5.2
OpenAI·Proprietary·400K

43.6

BenchAlign v5

91
MiniMax M2.5
MiniMax·Proprietary·128K

43.4

BenchAlign v5

92
MiMo-V2.5-Pro
Xiaomi·Proprietary·1M

43.4

BenchAlign v5

93
Hy3
Tencent·Open Weight·256K

43.2

BenchAlign v5

94
Mistral Small 4
Mistral·Open Weight·256K

42.9

BenchAlign v5

95
Mistral Large 3
Mistral·Proprietary·128K

42.8

BenchAlign v5

96
Mercury 2
Inception·Proprietary·128K

42.8

BenchAlign v5

97
GPT-5.4 nano
OpenAI·Proprietary·400K

42.8

BenchAlign v5

98
Claude 4 Sonnet
Anthropic·Proprietary·200K

42.8

BenchAlign v5

99
GPT-5 mini
OpenAI·Proprietary·128K

41.9

BenchAlign v5

100
Ling 2.6 Flash
InclusionAI·Open Weight·262K

41.7

BenchAlign v5

101
GPT-4.1 mini
OpenAI·Proprietary·1M

41.7

BenchAlign v5

102
LFM2.5-2.6B
LiquidAI·Open Weight·128K

41.5

BenchAlign v5

103
Kimi K2.6
Moonshot AI·Open Weight·256K

41.4

BenchAlign v5

104
Trinity-Large-Thinking
Arcee AI·Open Weight·512K

41.3

BenchAlign v5

105
GPT-4.1 nano
OpenAI·Proprietary·1M

41

BenchAlign v5

106
Inkling-Small
Thinking Machines Lab·Open Weight·1M

40.9

BenchAlign v5

107
Ornith-1.5-9B
Ornith AI·Open Weight·262K

40.5

BenchAlign v5

108
Inkling
Thinking Machines Lab·Open Weight·1M

39.9

BenchAlign v5

109
MiniMax M3
MiniMax·Open Weight·1M

39.8

BenchAlign v5

110
Kimi K2.7 Code
Moonshot AI·Open Weight·256K

39.7

BenchAlign v5

111
ZAYA1-8B
Zyphra·Open Weight·131K

39.6

BenchAlign v5

112
Kimi K2.5
Moonshot AI·Open Weight·256K

39.3

BenchAlign v5

113
Qwen3.7 Plus
Alibaba·Proprietary·1M

38.9

BenchAlign v5

114
Gemini 3.6 Flash
Google·Proprietary·1M

38.9

BenchAlign v5

115
Qwen3.7 Max
Alibaba·Proprietary·1M

38.5

BenchAlign v5

116
DeepSeek V3
DeepSeek·Open Weight·128K

38.5

BenchAlign v5

117
GPT-OSS 20B
OpenAI·Open Weight·128K

37.4

BenchAlign v5

118
GPT-5.4 mini
OpenAI·Proprietary·400K

37.4

BenchAlign v5

119
Qwen3.6 Plus
Alibaba·Proprietary·1M

37.1

BenchAlign v5

120
Gemma 3 27B
Google·Open Weight·32K

36

BenchAlign v5

121
Claude Opus 4.5
Anthropic·Proprietary·200K

35.7

BenchAlign v5

122
Gemini 3.1 Pro
Google·Proprietary·1M

35.4

BenchAlign v5

123
Llama 4 Scout
Meta·Open Weight·10M

35.1

BenchAlign v5

124
Nemotron 3 Ultra
NVIDIA·Open Weight·1M

34.4

BenchAlign v5

125
MiniMax M2.7
MiniMax·Open Weight·200K

34

BenchAlign v5

126
GPT-4o mini
OpenAI·Proprietary·128K

33.7

BenchAlign v5

127
Qwen3.6-27B
Alibaba·Open Weight·262K

31.8

BenchAlign v5

128

31.7

BenchAlign v5

129
Ministral 3 14B
Mistral·Open Weight·128K

31.7

BenchAlign v5

130
Gemini 3.5 Flash-Lite
Google·Proprietary·1M

31.3

BenchAlign v5

131
MiniCPM5-1B
OpenBMB·Open Weight·131K

28.8

BenchAlign v5

132
Grok Build 0.1
xAI·Proprietary·256K

28.8

BenchAlign v5

133
Gemma 4 31B
Google·Open Weight·256K

25.4

BenchAlign v5

134
Gemini 3 Flash
Google·Proprietary·1M

25.2

BenchAlign v5

135
Llama 4 Maverick
Meta·Open Weight·1M

24

BenchAlign v5

136
Ministral 3 8B
Mistral·Open Weight·128K

22.4

BenchAlign v5

137
Ministral 3 3B
Mistral·Open Weight·128K

20.9

BenchAlign v5

138
Grok 4.3
xAI·Proprietary·1M

6.2

BenchAlign v5

Key Takeaways

The top model is Claude Opus 5 by Anthropic with a BenchAlign v5 score of 80 and Supported evidence.

The best open-weight model is Qwen3.8 Max at position #5.

138 models are included in this ranking.

Score in Context

What these scores mean

The agentic score blends tool-use, browsing, computer-use, and long-horizon execution benchmarks. It carries 22% of the overall BenchLM score — the largest single category weight.

Known limitations

Agentic benchmarks bundle the model with a harness (scaffold, tools, retries). Your agent stack can move results by more than the gap between adjacent models here.

Best LLMs for AI Agents FAQ

What is the best LLM for AI agents?

Claude Mythos 5 and Claude Fable 5 currently top BenchLM's agentic category, with GPT-5.5 the strongest non-Anthropic option. The leaderboard above recomputes on every data refresh. For agent work specifically, weight Terminal-Bench 2, BrowseComp, and tau2-bench scores over general benchmarks.

What is the best AI agent?

This page ranks the models that power agents rather than packaged agent products. An agent product is a model plus a harness — tools, memory, retries — so the same model can perform very differently across products. Start from the strongest agentic model, then evaluate harnesses on your own tasks.

Do agentic benchmarks predict real-world agent performance?

Directionally yes, precisely no. Benchmarks like OSWorld-Verified and tau2-bench correlate with practical reliability, but they test specific environments with specific scaffolds. A 10-point gap usually matters; a 2-point gap can vanish under your own harness.

What is the cheapest good model for agents?

Agent loops burn tokens fast, so effective cost matters more than list price. Check the price-vs-performance view and the provider pricing hubs for cached-input rates — caching discounts of up to 90% dominate agent economics because loops resend the same context every step.

Last updated: August 27, 2026

Know when it’s worth switching models

The model to choose, the cheaper alternative, and the release we would wait on.

Read a sample issue

Join 2,000+ readers.

One email each week. Unsubscribe anytime.