Skip to main content
Radar

Keep up with the models you depend on. Follow price changes, retirements, and API updates.Follow the models you depend on.

Follow model changes

Artificial Analysis IFBench (AA-IFBench)

A display-only Artificial Analysis IFBench score.

Data verified 31 confirmed releases in the last 30 daysSee provider release alerts

Top models on AA-IFBench — September 10, 2026

As of September 10, 2026, MiniMax M3 leads the AA-IFBench leaderboard with 82.9% , followed by Nemotron 3 Ultra (81.4%) and Grok 4.3 (81.3%).

149 modelsInstruction Following30% of category scoreCurrentUpdated September 10, 2026

Leaderboard (149 models)

Score
1
MiniMax M3MiniMax · Open weight
82.9%
2
Nemotron 3 UltraNVIDIA · Open weight
81.4%
3
Grok 4.3xAI · Closed
81.3%
4
Qwen3.7 MaxAlibaba · Closed
80.5%
5
MiMo-V2.5-ProXiaomi · Closed
79.9%
6
Qwen3.7 PlusAlibaba · Closed
78.0%
7
GPT-5.2-CodexOpenAI · Closed
77.6%
8
Gemini 3.1 ProGoogle · Closed
77.1%
9
Qwen 3.6 Max (preview)Alibaba · Closed
76.6%
10
DeepSeek V4 Pro 0813DeepSeek · Closed
76.5%
11
Gemini 3.5 FlashGoogle · Closed
76.3%
12
GLM-5.1Z.AI · Open weight
76.3%
13
Kimi K2.6Moonshot AI · Open weight
76.0%
14
GPT-5.5OpenAI · Closed
75.9%
15
Muse SparkMeta · Closed
75.9%
16
GPT-5.4 nanoOpenAI · Closed
75.9%
17
MiniMax M2.7MiniMax · Open weight
75.7%
18
Qwen3.5-122B-A10BAlibaba · Open weight
75.7%
19
Gemma 4 31BGoogle · Open weight
75.6%
20
Qwen3.5-27BAlibaba · Open weight
75.6%
21
GPT-5.2OpenAI · Closed
75.4%
22
GPT-5.3 CodexOpenAI · Closed
75.4%
23
GPT-5.3-Codex-SparkOpenAI · Closed
75.4%
24
GPT-5 miniOpenAI · Closed
75.4%
25
Qwen3.6 PlusAlibaba · Closed
75.2%
26
GPT-5.4OpenAI · Closed
73.9%
27
Command A+Cohere · Open weight
73.9%
28
Gemma 4 12BGoogle · Open weight
73.5%
29
GLM-5.2Z.AI · Open weight
73.3%
30
GPT-5.4 miniOpenAI · Closed
73.3%
31
GLM-5-TurboZ.AI · Closed
73.2%
32
GPT-5 (high)OpenAI · Closed
73.1%
33
GPT-5.1OpenAI · Closed
72.9%
34
GPT-5.6 SolOpenAI · Closed
72.7%
35
Qwen3.5-35B-A3BAlibaba · Open weight
72.5%
36
Gemma 4 26B A4BGoogle · Open weight
72.4%
37
GLM-5Z.AI · Open weight
72.3%
38
MiniMax M2.5MiniMax · Closed
71.6%
39
Nemotron 3 Super 100BNVIDIA · Open weight
71.5%
40
Nemotron 3 Super 120B A12BNVIDIA · Open weight
71.5%
41
o3OpenAI · Closed
71.4%
42
DeepSeek V4 Pro (High)DeepSeek · Open weight
71.3%
43
GPT-5.6 TerraOpenAI · Closed
71.2%
44
Solar Pro 3Upstage · Closed
71.2%
45
Nemotron 3 Nano 30BNVIDIA · Open weight
71.1%
46
GPT-5 (medium)OpenAI · Closed
70.6%
47
Gemini 3 ProGoogle · Closed
70.4%
48
o1OpenAI · Closed
70.3%
49
Kimi K2.5Moonshot AI · Open weight
70.2%
50
Kimi K2.5 (Reasoning)Moonshot AI · Closed
70.2%
51
GPT-5.1-CodexOpenAI · Closed
70.0%
52
GPT-5.1-Codex-MaxOpenAI · Closed
70.0%
53
Mercury 2Inception · Closed
69.8%
54
GPT-OSS 120BOpenAI · Open weight
69.0%
55
Mistral Medium 3.5 128BMistral · Open weight
68.8%
56
MiMo-V2-ProXiaomi · Closed
68.8%
57
GLM-4.7Z.AI · Open weight
67.9%
58
Qwen3.6-27BAlibaba · Open weight
67.6%
59
GPT-5 nanoOpenAI · Closed
67.6%
60
Step 3.7 FlashStepFun · Open weight
67.3%
61
Step 3.5 FlashStepFun · Open weight
66.5%
62
GPT-OSS 20BOpenAI · Open weight
65.1%
63
K-ExaoneLG AI Research · Closed
64.7%
64
Qwen3.6-35B-A3BAlibaba · Open weight
64.4%
65
Claude Fable 5Anthropic · Closed
63.5%
66
Nemotron 3 Nano Omni 30B A3BNVIDIA · Open weight
63.2%
67
Kimi K2.7 CodeMoonshot AI · Open weight
63.1%
68
Claude Opus 4.8Anthropic · Closed
62.2%
69
GLM-5V-TurboZ.AI · Closed
61.1%
70
GLM-4.7-FlashZ.AI · Open weight
60.8%
71
Claude Opus 4.7 (Adaptive)Anthropic · Closed
58.6%
72
Claude Opus 4.5 ThinkingAnthropic · Closed
58.0%
73
North Mini CodeCohere · Open weight
57.6%
74
Ling 2.6 FlashInclusionAI · Open weight
57.4%
75
Trinity-Large-ThinkingArcee AI · Open weight
56.3%
76
Trinity-Large-PreviewArcee AI · Open weight
56.3%
77
LFM2.5-8B-A1BLiquidAI · Open weight
55.6%
78
Claude 4.1 Opus ThinkingAnthropic · Closed
55.4%
79
Gemini 3 FlashGoogle · Closed
55.1%
80
Grok 4xAI · Closed
53.7%
81
MiMo-V2-OmniXiaomi · Closed
53.5%
82
Claude Opus 4.6 (Adaptive)Anthropic · Closed
53.1%
83
52.7%
84
Qwen3.5 397BAlibaba · Open weight
51.6%
85
Qwen3.5 397B (Reasoning)Alibaba · Open weight
51.6%
86
50.5%
87
DeepSeek V3.2DeepSeek · Open weight
49.0%
88
Gemini 2.5 ProGoogle · Closed
48.7%
89
Mistral Small 4Mistral · Open weight
48.2%
90
Mistral Small 4 (Reasoning)Mistral · Open weight
48.2%
91
Ultravox v0.6 Llama 3.3 70BFixie AI · Open weight
47.1%
92
LFM2-24B-A2BLiquidAI · Closed
45.9%
93
Claude 4 SonnetAnthropic · Closed
45.4%
94
Claude Opus 4.6Anthropic · Closed
44.6%
95
Gemma 4 E4BGoogle · Open weight
44.2%
96
Qwen3 MaxAlibaba · Closed
44.1%
97
LFM2.5-1.2B-InstructLiquidAI · Closed
43.8%
98
Claude Opus 4.7Anthropic · Closed
43.6%
99
Qwen3-Omni-30B-A3B-ThinkingAlibaba · Open weight
43.4%
100
Claude Opus 4.5Anthropic · Closed
43.0%
101
Llama 4 MaverickMeta · Open weight
43.0%
102
GPT-4.1OpenAI · Closed
43.0%
103
MiniMax M1 80kMiniMax · Closed
41.8%
104
LFM2.5-1.2B-ThinkingLiquidAI · Closed
41.8%
105
DeepSeek V3.1 (Reasoning)DeepSeek · Open weight
41.5%
106
Kimi K2Moonshot AI · Closed
41.5%
107
Grok Code Fast 1xAI · Closed
41.4%
108
Claude Sonnet 4.6Anthropic · Closed
41.2%
109
MiMo-V2-FlashXiaomi · Open weight
39.9%
110
DeepSeek-R1DeepSeek · Open weight
39.6%
111
Llama 4 ScoutMeta · Open weight
39.5%
112
Mistral Medium 3Mistral · Closed
39.3%
113
Gemini 2.5 FlashGoogle · Closed
39.0%
114
Llama 3.1 405BMeta · Open weight
39.0%
115
GPT-4.1 miniOpenAI · Closed
38.3%
116
Nemotron Ultra 253BNVIDIA · Open weight
38.2%
117
Nova ProAmazon · Closed
38.1%
118
Gemma 4 E2BGoogle · Open weight
38.0%
119
DeepSeek V3.1DeepSeek · Open weight
37.8%
120
GLM-4.5-AirZ.AI · Closed
37.6%
121
GLM-4.6Z.AI · Open weight
36.7%
122
Grok 4.1 FastxAI · Closed
36.5%
123
Mistral Large 3Mistral · Closed
36.2%
124
Claude 3 HaikuAnthropic · Closed
36.1%
125
DeepSeek V3DeepSeek · Open weight
34.8%
126
Sarvam 105BSarvam · Open weight
34.4%
127
GPT-4oOpenAI · Closed
34.3%
128
Solar Pro 2Upstage · Closed
33.7%
129
Exaone 4.0 32BLG AI Research · Open weight
33.5%
130
LFM2.5-VL-1.6B-ExtractLiquidAI · Open weight
33.1%
131
GPT-4.1 nanoOpenAI · Closed
32.0%
132
Ministral 3 14B (Reasoning)Mistral · Open weight
32.0%
133
Ministral 3 14BMistral · Open weight
32.0%
134
Gemma 3 27BGoogle · Open weight
31.8%
135
Mistral Large 2Mistral · Closed
31.2%
136
Qwen3-Omni-30B-A3B-InstructAlibaba · Open weight
31.2%
137
GPT-4o miniOpenAI · Closed
31.0%
138
Ministral 3 8B (Reasoning)Mistral · Open weight
29.1%
139
Ministral 3 8BMistral · Open weight
29.1%
140
Ministral 3 3B (Reasoning)Mistral · Open weight
26.8%
141
Ministral 3 3BMistral · Open weight
26.8%
142
Sarvam 30BSarvam · Open weight
26.5%
143
Granite-4.0-H-1BIBM · Open weight
26.2%
144
Exaone 4.0 1.2BLG AI Research · Open weight
25.3%
145
Phi-4Microsoft · Open weight
23.5%
146
DeepSeek R1 Distill Qwen 32BDeepSeek · Open weight
22.9%
147
Granite-4.0-1BIBM · Open weight
20.5%
148
Granite-4.0-H-350MIBM · Open weight
17.6%
149
Granite-4.0-350MIBM · Open weight
15.9%

According to BenchLM.ai, MiniMax M3 leads the AA-IFBench benchmark with a score of 82.9%, followed by Nemotron 3 Ultra (81.4%) and Grok 4.3 (81.3%). The top models are clustered within 1.6 points, suggesting this benchmark is nearing saturation for frontier models.

149 models have been evaluated on AA-IFBench. The benchmark falls in the Instruction Following category. This category carries a 5% weight in BenchLM.ai's overall scoring system. Within that category, AA-IFBench contributes 30% of the category score, so strong performance here directly affects a model's overall ranking.

About AA-IFBench

Year

2026

Tasks

Verifiable instruction constraints

Format

Constraint satisfaction accuracy

Difficulty

Instruction precision

BenchLM stores the Artificial Analysis IFBench result separately from the weighted IFBench lane so AA refreshes remain display-only.

BenchLM freshness & provenance

Version

AA-IFBench 2026

Refresh cadence

Quarterly

Staleness state

Current

Question availability

Public benchmark set

Current

BenchLM uses freshness metadata to decide whether a benchmark should still be treated as a strong differentiator, a benchmark to watch, or a display-only reference. For the full scoring policy, see the BenchLM methodology page.

FAQ

What does AA-IFBench measure?

A display-only Artificial Analysis IFBench score.

Which model scores highest on AA-IFBench?

MiniMax M3 by MiniMax currently leads with a score of 82.9% on AA-IFBench.

How many models are evaluated on AA-IFBench?

149 AI models have been evaluated on AA-IFBench on BenchLM.

Last updated: September 10, 2026 · BenchLM version AA-IFBench 2026

Know when it’s worth switching models

The model to choose, the cheaper alternative, and the release we would wait on.

Read a sample issue

Join 2,000+ readers.

One email each week. Unsubscribe anytime.