Skip to main content
Radar

Every change to the models you run, with its source and its date. Releases, price changes, retirements, API changes, and incidents.Every change to the models you run, with its source.

Follow model changes

BullshitBench v2

A benchmark that tests whether AI models challenge nonsensical, ill-posed, or logically flawed prompts instead of confidently generating incorrect answers. Measures the critical ability to push back on bad input.

How BenchLM shows BullshitBench v2

BenchLM mirrors the published BullshitBench v2 leaderboard using the official snapshot generated on September 10, 2026 at 8:20 PM UTC. The public view reports per-model clear-pushback rates across 100 nonsense prompts, scored by a 3-judge panel.

BullshitBench is a useful reasoning sanity check, but BenchLM currently keeps it display only rather than weighted. The public leaderboard is highly variant-specific and exposes reasoning-effort settings directly, so BenchLM treats it as a mirrored external benchmark instead of a canonical ranking input.

Snapshot

214 model variants121 base models100 nonsense prompts3 judgesDisplay only

Clear pushback rate on BullshitBench v2 — September 10, 2026 at 8:20 PM UTC

We mirror the published clear pushback rate view for BullshitBench v2. Claude Opus 4.8 leads the public snapshot at 95%, followed by Qwen3.8 Max (95%) and Claude Opus 4.8 (94%). We do not use these results to rank models overall.

214 modelsReasoningCurrentDisplay onlyUpdated September 10, 2026 at 8:20 PM UTC

Clear pushback rate table (214 models)

Score
1
Claude Opus 4.8Anthropic · Closed
95%
2
Qwen3.8 MaxAlibaba · Open weight
95%
3
Claude Opus 4.8Anthropic · Closed
94%
4
Claude Sonnet 4.6Anthropic · Closed
91%
5
Claude Opus 4.5Anthropic · Closed
90%
6
Claude Sonnet 4.6Anthropic · Closed
89%
7
Claude Opus 4.6Anthropic · Closed
87%
8
Claude Opus 4.6Anthropic · Closed
83%
9
Claude Opus 4.7Anthropic · Closed
83%
10
Claude Sonnet 5Anthropic · Closed
80%
11
Claude Sonnet 4.5Anthropic · Closed
79%
12
Claude Opus 4.5Anthropic · Closed
79%
13
Qwen3.8-27BAlibaba · Open weight
79%
14
Claude Sonnet 5Anthropic · Closed
78%
15
Qwen3.5 397B (Reasoning)Alibaba · Open weight
78%
16
Claude Fable 5.1Anthropic · Closed
77%
17
Claude Haiku 4.5Anthropic · Closed
77%
18
Kimi K3Moonshot AI · Closed
74%
19
Claude Opus 4.7Anthropic · Closed
74%
20
Claude Sonnet 4.5Anthropic · Closed
74%
21
Claude Opus 5Anthropic · Closed
73%
22
Kimi K3Moonshot AI · Closed
72%
23
GLM-5.3Z.AI · Open weight
72%
24
Qwen3.7 MaxAlibaba · Closed
72%
25
Qwen3.6 PlusAlibaba · Closed
72%
26
Claude Haiku 4.5Anthropic · Closed
71%
27
Claude Opus 5Anthropic · Closed
70%
28
GPT-6 AstraOpenAI · Closed
69%
29
Qwen3.5 397BAlibaba · Open weight
69%
30
67%
31
GLM-5.3Z.AI · Open weight
66%
32
Gemini 3.5 Flash-LiteGoogle · Closed
66%
33
Grok 4.6xAI · Closed
66%
34
Kimi K2.6Moonshot AI · Open weight
65%
36
Claude Fable 5.1Anthropic · Closed
64%
37
GPT-6 AstraOpenAI · Closed
64%
38
MiniMax M3MiniMax · Open weight
64%
39
64%
40
Qwen3.6 PlusAlibaba · Closed
63%
41
MiniMax M3MiniMax · Open weight
63%
42
MiMo-V2.5-ProXiaomi · Closed
62%
43
Gemini 3.5 Flash-LiteGoogle · Closed
60%
44
Qwen3.6 PlusAlibaba · Closed
59%
45
DeepSeek V4.1 FlashDeepSeek · Open weight
57%
46
DeepSeek V4.1 FlashDeepSeek · Open weight
57%
47
Qwen3.7 MaxAlibaba · Closed
57%
48
Claude Fable 5Anthropic · Closed
56%
49
Grok 4.6xAI · Closed
56%
50
Grok 4.20xAI · Closed
56%
51
Grok 4.5xAI · Closed
55%
53
GPT-5.6 TerraOpenAI · Closed
54%
54
Grok 4.5xAI · Closed
54%
55
Grok 4.20xAI · Closed
54%
56
Nemotron 3 Super 120B A12BNVIDIA · Open weight
54%
57
Kimi K2.5Moonshot AI · Open weight
52%
58
Grok 4.3xAI · Closed
50%
59
Kimi K2.6Moonshot AI · Open weight
50%
60
Muse Spark 1.2Meta · Closed
50%
62
Muse Spark 1.2Meta · Closed
49%
65
GPT-5.6 SolOpenAI · Closed
48%
66
GPT-5.4OpenAI · Closed
48%
67
Gemini 3 ProGoogle · Closed
48%
68
GPT-5.6 SolOpenAI · Closed
47%
69
GPT-5.5OpenAI · Closed
47%
70
GPT-5.6 TerraOpenAI · Closed
47%
71
Nemotron 3 Super 120B A12BNVIDIA · Open weight
47%
72
Qwen3.6 PlusAlibaba · Closed
46%
73
Grok 4.3xAI · Closed
46%
74
Claude 3.5 SonnetAnthropic · Closed
46%
75
Claude Fable 5Anthropic · Closed
45%
76
GPT-5.5OpenAI · Closed
45%
77
GPT-5.5OpenAI · Closed
45%
78
GPT-5.2-CodexOpenAI · Closed
45%
79
GPT-5.1OpenAI · Closed
45%
81
Claude 4.1 OpusAnthropic · Closed
43%
82
Nemotron 3 Super 120B A12BNVIDIA · Open weight
43%
84
GPT-5.4OpenAI · Closed
42%
85
Claude 4.1 OpusAnthropic · Closed
42%
86
GPT-5.6 LunaOpenAI · Closed
41%
87
GPT-5.3 InstantOpenAI · Closed
40%
89
DeepSeek V4 Flash 0731DeepSeek · Closed
39%
91
GPT-5.2-CodexOpenAI · Closed
39%
92
Gemini 3.6 FlashGoogle · Closed
39%
93
GPT-5.2OpenAI · Closed
38%
94
MiMo-V2.5-ProXiaomi · Closed
38%
95
GPT-5.6 LunaOpenAI · Closed
37%
96
Gemini 3.1 ProGoogle · Closed
37%
97
GPT-5.2-CodexOpenAI · Closed
37%
99
GPT-5.5 ProOpenAI · Closed
36%
100
Gemini 3 Pro Deep ThinkGoogle · Closed
36%
101
DeepSeek V4 Pro 0813DeepSeek · Closed
35%
102
Gemini 3.7 FlashGoogle · Closed
35%
103
MiMo-V2.5Xiaomi · Closed
35%
105
GPT-5.5 ProOpenAI · Closed
34%
106
GPT-5.5OpenAI · Closed
34%
108
GPT-5.4 miniOpenAI · Closed
32%
109
GPT-5.4 miniOpenAI · Closed
32%
110
DeepSeek V4 Pro 0813DeepSeek · Closed
32%
111
GPT-5.1-Codex-MaxOpenAI · Closed
32%
112
GPT-5.4 miniOpenAI · Closed
31%
113
Kimi K2.5 (Reasoning)Moonshot AI · Closed
31%
114
Gemini 3.1 ProGoogle · Closed
31%
115
Gemini 3.7 FlashGoogle · Closed
31%
116
GLM-5-TurboZ.AI · Closed
31%
117
Nemotron 3 Super 120B A12BNVIDIA · Open weight
31%
118
GLM-5.2Z.AI · Open weight
31%
119
Claude 4 SonnetAnthropic · Closed
30%
120
Qwen3.8-27BAlibaba · Open weight
29%
121
Claude 4 SonnetAnthropic · Closed
29%
122
Llama 4 MaverickMeta · Open weight
29%
123
GPT-5.2OpenAI · Closed
28%
124
Gemini 3.6 FlashGoogle · Closed
28%
125
GLM-5 (Reasoning)Z.AI · Open weight
28%
127
Qwen3.8 MaxAlibaba · Open weight
27%
128
GPT-5.2 InstantOpenAI · Closed
27%
129
o3OpenAI · Closed
26%
131
GPT-5.1OpenAI · Closed
25%
132
Gemma 4 31BGoogle · Open weight
25%
133
GPT-5.3 CodexOpenAI · Closed
24%
134
MiMo-V2.5Xiaomi · Closed
24%
135
GLM-5-TurboZ.AI · Closed
23%
136
GLM-5.1Z.AI · Open weight
22%
137
Step 3.5 FlashStepFun · Open weight
22%
138
Laguna S 2.1Poolside · Open weight
22%
139
21%
140
Gemma 4 26B A4BGoogle · Open weight
21%
141
Laguna S 2.1Poolside · Open weight
21%
142
GPT-5.3 CodexOpenAI · Closed
20%
143
DeepSeek V4 Flash 0731DeepSeek · Closed
20%
145
Gemini 2.5 ProGoogle · Closed
20%
146
GLM-5Z.AI · Open weight
20%
147
Llama 4 ScoutMeta · Open weight
20%
148
Gemma 4 31BGoogle · Open weight
20%
149
Gemini 3.5 FlashGoogle · Closed
20%
150
GPT-5.3 CodexOpenAI · Closed
19%
151
Grok 4.1 FastxAI · Closed
19%
152
Gemini 2.5 FlashGoogle · Closed
19%
153
Gemini 3.5 FlashGoogle · Closed
19%
154
18%
155
DeepSeek V4 Flash 0731DeepSeek · Closed
18%
156
GLM-5.1Z.AI · Open weight
18%
157
GLM-5.2Z.AI · Open weight
17%
158
Trinity-Large-ThinkingArcee AI · Open weight
17%
159
MiMo-V2-FlashXiaomi · Open weight
16%
160
Hy3Tencent · Open weight
16%
162
DeepSeek V4 Pro 0813DeepSeek · Closed
14%
164
GPT-5.4 nanoOpenAI · Closed
14%
165
GPT-5.4 nanoOpenAI · Closed
14%
166
DeepSeek V4 Pro 0813DeepSeek · Closed
14%
167
GPT-4.1OpenAI · Closed
14%
168
DeepSeek V4 Flash 0731DeepSeek · Closed
14%
169
DeepSeek V3.2 (Thinking)DeepSeek · Open weight
13%
170
Step 3.5 FlashStepFun · Open weight
13%
171
Trinity-Large-ThinkingArcee AI · Open weight
13%
172
MiMo-V2-FlashXiaomi · Open weight
13%
173
GPT-4oOpenAI · Closed
12%
174
GPT-OSS 120BOpenAI · Open weight
12%
175
Gemma 4 26B A4BGoogle · Open weight
11%
176
Gemini 3.1 Flash-LiteGoogle · Closed
11%
177
Seed 1.6ByteDance · Closed
11%
179
GPT-5.4 nanoOpenAI · Closed
10%
180
Gemini 3 FlashGoogle · Closed
10%
181
DeepSeek V3.2DeepSeek · Open weight
10%
182
Claude 3 HaikuAnthropic · Closed
10%
183
Gemini 3 FlashGoogle · Closed
10%
185
Kimi K2Moonshot AI · Closed
10%
186
Grok 4.1 FastxAI · Closed
10%
187
MiniMax M2.5MiniMax · Closed
9%
188
Hy3Tencent · Open weight
8%
189
MiniMax M2.5MiniMax · Closed
8%
190
GLM-4.5Z.AI · Closed
8%
191
MiniMax M2.7MiniMax · Open weight
8%
192
DeepSeek-R1DeepSeek · Open weight
8%
193
o4-mini (high)OpenAI · Closed
8%
194
Seed 1.6ByteDance · Closed
7%
195
MiniMax M2.7MiniMax · Open weight
7%
196
DeepSeek-R1DeepSeek · Open weight
7%
200
GLM-4.5Z.AI · Closed
6%
201
GPT-OSS 120BOpenAI · Open weight
5%
204
5%
205
o4-mini (high)OpenAI · Closed
4%
214
GPT-4o miniOpenAI · Closed
2%

The published BullshitBench v2 snapshot places Claude Opus 4.8 first at 95%. The third row is 1.0 points behind. The broader top-10 range is 15.0 points, so the table still separates the published systems.

214 models have been evaluated on BullshitBench v2. The benchmark falls in the Reasoning category. This category carries a 17% weight in BenchLM.ai's overall scoring system. BullshitBench v2 is currently displayed for reference but excluded from the scoring formula, so it does not directly affect overall rankings.

About BullshitBench v2

Year

2025

Tasks

Nonsensical and flawed prompts across multiple domains

Format

Prompt challenge and refusal evaluation

Difficulty

Robustness and critical reasoning

BullshitBench evaluates a crucial real-world capability: knowing when NOT to answer. Models that score highly recognize flawed premises, impossible physics scenarios, and logical contradictions rather than hallucinating plausible-sounding responses. V2 includes harder and more diverse challenge categories.

BenchLM freshness & provenance

Version

BullshitBench v2 2025

Refresh cadence

Quarterly

Staleness state

Current

Question availability

Public benchmark set

CurrentDisplay only

BenchLM uses freshness metadata to decide whether a benchmark should still be treated as a strong differentiator, a benchmark to watch, or a display-only reference. For the full scoring policy, see the BenchLM methodology page.

FAQ

What does BullshitBench v2 measure?

A benchmark that tests whether AI models challenge nonsensical, ill-posed, or logically flawed prompts instead of confidently generating incorrect answers. Measures the critical ability to push back on bad input.

Which model leads the published BullshitBench v2 snapshot?

Claude Opus 4.8 currently leads the published BullshitBench v2 snapshot with 95% clear pushback rate. BenchLM shows this benchmark for display only and does not use it in overall rankings.

How many models are evaluated on BullshitBench v2?

The September 10, 2026 at 8:20 PM UTC snapshot contains 214 AI models.

Last updated: September 10, 2026 at 8:20 PM UTC · mirrored from the public benchmark leaderboard

Know when it’s worth switching models

The model to choose, the cheaper alternative, and the release we would wait on.

Read a sample issue

Join 2,000+ readers.

One email each week. Unsubscribe anytime.