Skip to main content
BenchLM

Critical Physics Tasks (CritPt)

Data verified 34 confirmed releases in the last 30 daysFollow model changes

An Artificial Analysis metric for research-level physics reasoning.

Top models on CritPt — September 27, 2026

As of September 27, 2026, GPT-5.6 Sol leads the CritPt leaderboard with 32.3% , followed by GPT-6 Astra (31.7%) and Claude Opus 5.5 (31.7%).

199 modelsReasoningFeeds the overall rankingCurrentUpdated September 27, 2026

Leaderboard (199 models)

Score
1
GPT-5.6 SolOpenAI · Closed
32.3%
2
GPT-6 AstraOpenAI · Closed
31.7%
3
Claude Opus 5.5Anthropic · Closed
31.7%
4
GPT-6 SolOpenAI · Closed
30.9%
5
GPT-5.5 ProOpenAI · Closed
30.6%
6
GPT-5.6 TerraOpenAI · Closed
30.0%
7
GPT-5.4 ProOpenAI · Closed
30.0%
8
Claude Fable 5.1Anthropic · Closed
29.7%
9
Claude Opus 5Anthropic · Closed
29.1%
10
Claude Fable 5Anthropic · Closed
28.6%
11
GPT-5.5OpenAI · Closed
27.1%
12
MiMo-V2.6-ProXiaomi · Open weight
26.6%
13
Gemini 3 Pro Deep ThinkGoogle · Closed
25.7%
14
Muse Spark 1.3Meta · Closed
24.9%
15
Kimi K3Moonshot AI · Closed
23.4%
16
GPT-5.4OpenAI · Closed
23.4%
17
Claude Opus 4.8Anthropic · Closed
20.9%
18
GLM-5.2Z.AI · Open weight
20.9%
19
Step 5 PreviewStepFun · Closed
20.9%
20
GPT-5.6 LunaOpenAI · Closed
20.6%
21
GPT-6 LunaOpenAI · Closed
19.4%
22
GLM-5.3Z.AI · Open weight
19.1%
23
Gemini 3.8 FlashGoogle · Closed
18.3%
24
DeepSeek V4 Pro 0813DeepSeek · Open weight
18.0%
25
Gemini 3.1 ProGoogle · Closed
17.7%
26
Muse Spark 1.2Meta · Closed
17.7%
27
Grok 4.7xAI · Closed
17.7%
28
Qwen3.8 Max PreviewAlibaba · Closed
17.7%
29
Grok 4.6xAI · Closed
17.1%
30
Claude Sonnet 5Anthropic · Closed
16.9%
31
GPT-5.3 CodexOpenAI · Closed
16.9%
32
Hy4 previewTencent · Open weight
16.9%
33
GPT-5.3-Codex-SparkOpenAI · Closed
16.9%
34
DeepSeek V4 Flash 0731DeepSeek · Open weight
16.6%
35
Grok 4.5xAI · Closed
15.4%
36
Muse Spark 1.1Meta · Closed
15.1%
37
Gemini 3.7 FlashGoogle · Closed
14.3%
38
DeepSeek V4.1 FlashDeepSeek · Open weight
14.3%
39
Qwen3.7 MaxAlibaba · Closed
13.4%
40
Gemini 3.5 FlashGoogle · Closed
13.1%
41
Claude Opus 4.6 (Adaptive)Anthropic · Closed
12.6%
42
Claude Opus 4.7 (Adaptive)Anthropic · Closed
12.0%
43
GPT-5.2OpenAI · Closed
11.6%
44
Muse SparkMeta · Closed
11.3%
45
Qwen3.8-Flash-NextAlibaba · Open weight
11.1%
46
Gemini 3.6 FlashGoogle · Closed
10.6%
47
Kimi K2.7 CodeMoonshot AI · Open weight
10.0%
48
GPT-5.4 miniOpenAI · Closed
10.0%
49
DeepSeek V4 Pro (High)DeepSeek · Open weight
10.0%
50
Quasar 438BMultiverse Computing · Closed
9.4%
51
GPT-5.4 nanoOpenAI · Closed
9.3%
52
Qwen3.7 PlusAlibaba · Closed
9.1%
53
Gemini 3 ProGoogle · Closed
9.1%
54
A.X K2SK Telecom · Open weight
8.9%
55
GPT-5.2-CodexOpenAI · Closed
8.7%
56
Inkling-SmallThinking Machines Lab · Open weight
8.3%
57
Kimi K2.6Moonshot AI · Open weight
8.0%
58
Grok 4.3xAI · Closed
8.0%
59
GPT-5.1-CodexOpenAI · Closed
5.7%
60
GPT-5.1-Codex-MaxOpenAI · Closed
5.7%
61
GPT-5 (high)OpenAI · Closed
5.7%
62
InklingThinking Machines Lab · Open weight
5.4%
63
Qwen3.8-27BAlibaba · Open weight
5.4%
64
Solar Pro 4Upstage · Closed
5.4%
65
Claude Opus 4.7Anthropic · Closed
5.1%
66
GPT-5.1OpenAI · Closed
4.9%
67
Hy3Tencent · Open weight
4.9%
68
Hy3 PreviewTencent · Open weight
4.9%
69
GLM-5.1Z.AI · Open weight
4.6%
70
Apodex 1.1Apodex · Closed
4.6%
71
Claude Opus 4.5 ThinkingAnthropic · Closed
4.6%
72
Apodex 1.1 MiniApodex · Open weight
4.6%
73
MiMo-V2.5-ProXiaomi · Closed
4.0%
74
MiniMax M3MiniMax · Open weight
3.7%
75
Qwen 3.6 Max (preview)Alibaba · Closed
3.7%
76
Kimi K2.5Moonshot AI · Open weight
3.1%
77
Nemotron 3 UltraNVIDIA · Open weight
3.1%
78
Kimi K2.5 (Reasoning)Moonshot AI · Closed
3.1%
79
Nemotron 3 Super 100BNVIDIA · Open weight
3.1%
80
Nemotron 3 Super 120B A12BNVIDIA · Open weight
3.1%
81
Qwen3.6 PlusAlibaba · Closed
2.9%
82
2.9%
83
2.9%
84
Claude Opus 4.6Anthropic · Closed
2.8%
85
Muse Glimmer 30BMeta · Open weight
2.6%
86
Gemini 2.5 ProGoogle · Closed
2.6%
87
Step 3.7 FlashStepFun · Open weight
2.3%
88
Step 3.5 FlashStepFun · Open weight
2.3%
89
GLM-5Z.AI · Open weight
2.0%
90
Ling 3.0 Flash VLInclusionAI · Open weight
2.0%
91
Grok 4xAI · Closed
2.0%
92
DeepSeek V3.1 (Reasoning)DeepSeek · Open weight
2.0%
93
Ling 3.0 FlashInclusionAI · Open weight
1.7%
94
GLM-4.7Z.AI · Open weight
1.7%
95
Ling 3.0 Flash FP8InclusionAI · Open weight
1.7%
96
Gemma 4 31BGoogle · Open weight
1.4%
97
Gemini 3 FlashGoogle · Closed
1.4%
98
DeepSeek-R1DeepSeek · Open weight
1.4%
99
Gemini 2.5 FlashGoogle · Closed
1.4%
100
GPT-OSS 20BOpenAI · Open weight
1.4%
101
Qwen3.6-27BAlibaba · Open weight
1.1%
102
o3OpenAI · Closed
1.1%
103
MiMo-V2-OmniXiaomi · Closed
1.1%
104
K-ExaoneLG AI Research · Closed
1.1%
105
GPT-OSS 120BOpenAI · Open weight
1.1%
106
Claude 4 SonnetAnthropic · Closed
1.1%
107
MiniMax M2.5MiniMax · Closed
1.1%
108
Claude Sonnet 4.6Anthropic · Closed
0.9%
109
Qwen3.5 397BAlibaba · Open weight
0.9%
110
Qwen3.5-27BAlibaba · Open weight
0.9%
111
Qwen3.5-35B-A3BAlibaba · Open weight
0.9%
112
DeepSeek V3.2DeepSeek · Open weight
0.9%
113
Trinity-Large-ThinkingArcee AI · Open weight
0.9%
114
Qwen3.5 397B (Reasoning)Alibaba · Open weight
0.9%
115
Trinity-Large-PreviewArcee AI · Open weight
0.9%
116
Nemotron 3 Nano 30BNVIDIA · Open weight
0.9%
117
K-EXAONE 2.0LG AI Research · Open weight
0.9%
118
Mercury 2Inception · Closed
0.8%
119
MiniMax M2.7MiniMax · Open weight
0.6%
120
Qwen3.5-122B-A10BAlibaba · Open weight
0.6%
121
GLM-5V-TurboZ.AI · Closed
0.6%
122
Gemma 4 E4BGoogle · Open weight
0.6%
123
Claude Opus 4.5Anthropic · Closed
0.3%
124
Qwen3.6-35B-A3BAlibaba · Open weight
0.3%
125
GLM-5-TurboZ.AI · Closed
0.3%
126
MiMo-V2-ProXiaomi · Closed
0.3%
127
o1OpenAI · Closed
0.3%
128
Mistral Small 4Mistral · Open weight
0.3%
129
Granite 4.2 30BIBM · Open weight
0.3%
130
Granite 4.2 8BIBM · Open weight
0.3%
131
Command A+Cohere · Open weight
0.3%
132
MiniCPM5-2BOpenBMB · Open weight
0.3%
133
Sarvam 30BSarvam · Open weight
0.3%
134
North Mini CodeCohere · Open weight
0.3%
135
Mistral Small 4 (Reasoning)Mistral · Open weight
0.3%
136
GLM-4.7-FlashZ.AI · Open weight
0.3%
137
Gemma 4 26B A4BGoogle · Open weight
0.0%
138
Gemma 4 12BGoogle · Open weight
0.0%
139
Nemotron 3 Nano Omni 30B A3BNVIDIA · Open weight
0.0%
140
GPT-5 (medium)OpenAI · Closed
0.0%
141
Claude 4.1 Opus ThinkingAnthropic · Closed
0.0%
142
Gemini 3.5 Flash-LiteGoogle · Closed
0.0%
143
Mistral Medium 3.5 128BMistral · Open weight
0.0%
144
Exaone 4.0 32BLG AI Research · Open weight
0.0%
145
Celeris-1Celeris · Closed
0.0%
146
Qwen3 MaxAlibaba · Closed
0.0%
147
Kimi K2Moonshot AI · Closed
0.0%
148
Ling 3.0 TinyInclusionAI · Open weight
0.0%
149
DeepSeek V3.1DeepSeek · Open weight
0.0%
150
Solar Pro 3Upstage · Closed
0.0%
151
Llama 4 MaverickMeta · Open weight
0.0%
152
GLM-4.5-AirZ.AI · Closed
0.0%
153
MiMo-V2-FlashXiaomi · Open weight
0.0%
154
GPT-4oOpenAI · Closed
0.0%
155
GLM-4.6Z.AI · Open weight
0.0%
156
Mistral Large 3Mistral · Closed
0.0%
157
Mistral Large 2Mistral · Closed
0.0%
158
GPT-4.1OpenAI · Closed
0.0%
159
DeepSeek V3DeepSeek · Open weight
0.0%
160
Mistral Medium 3Mistral · Closed
0.0%
161
Grok Code Fast 1xAI · Closed
0.0%
162
Granite 4.2 3BIBM · Open weight
0.0%
163
Grok 4.1 FastxAI · Closed
0.0%
164
Llama 4 ScoutMeta · Open weight
0.0%
165
GPT-4.1 miniOpenAI · Closed
0.0%
166
Claude 3 HaikuAnthropic · Closed
0.0%
167
Nova ProAmazon · Closed
0.0%
168
Ling 2.6 FlashInclusionAI · Open weight
0.0%
169
Sarvam 105BSarvam · Open weight
0.0%
170
Solar Pro 2Upstage · Closed
0.0%
171
0.0%
172
Qwen3-Omni-30B-A3B-InstructAlibaba · Open weight
0.0%
173
LFM2.5-2.6BLiquidAI · Open weight
0.0%
174
Gemma 4 E2BGoogle · Open weight
0.0%
175
GPT-4.1 nanoOpenAI · Closed
0.0%
176
Granite-4.0-H-1BIBM · Open weight
0.0%
177
Gemma 3 27BGoogle · Open weight
0.0%
178
Phi-4Microsoft · Open weight
0.0%
179
Granite-4.0-350MIBM · Open weight
0.0%
180
Granite-4.0-H-350MIBM · Open weight
0.0%
181
Exaone 4.0 1.2BLG AI Research · Open weight
0.0%
182
LFM2.5-8B-A1BLiquidAI · Open weight
0.0%
183
Llama 3.1 405BMeta · Open weight
0.0%
184
Nemotron Ultra 253BNVIDIA · Open weight
0.0%
185
LFM2.5-VL-1.6B-ExtractLiquidAI · Open weight
0.0%
186
Qwen3-Omni-30B-A3B-ThinkingAlibaba · Open weight
0.0%
187
Ultravox v0.6 Llama 3.3 70BFixie AI · Open weight
0.0%
188
GPT-5 miniOpenAI · Closed
0.0%
189
Ministral 3 14B (Reasoning)Mistral · Open weight
0.0%
190
Ministral 3 14BMistral · Open weight
0.0%
191
GPT-5 nanoOpenAI · Closed
0.0%
192
MiniMax M1 80kMiniMax · Closed
0.0%
193
LFM2-24B-A2BLiquidAI · Closed
0.0%
194
Ministral 3 8B (Reasoning)Mistral · Open weight
0.0%
195
LFM2.5-1.2B-ThinkingLiquidAI · Closed
0.0%
196
Ministral 3 8BMistral · Open weight
0.0%
197
Ministral 3 3B (Reasoning)Mistral · Open weight
0.0%
198
LFM2.5-1.2B-InstructLiquidAI · Closed
0.0%
199
Ministral 3 3BMistral · Open weight
0.0%

According to BenchLM.ai, GPT-5.6 Sol leads the CritPt benchmark with a score of 32.3%, followed by GPT-6 Astra (31.7%) and Claude Opus 5.5 (31.7%). The top models are clustered within 0.6 points, suggesting this benchmark is nearing saturation for frontier models.

199 models have been evaluated on CritPt. The benchmark falls in the Reasoning category. CritPt does not enter the Reasoning category score, but BenchAlign v5.7 uses it in the overall ranking.

About CritPt

Year

2026

Tasks

Research-level physics questions

Format

Accuracy

Difficulty

Research-level physics reasoning

BenchLM stores CritPt results from Artificial Analysis' independently evaluated leaderboard.

Freshness and provenance

Version

CritPt 2026

Refresh cadence

Quarterly

Staleness state

Current

Question availability

Public benchmark set

Current

BenchLM uses freshness metadata to decide whether a benchmark should still be treated as a strong differentiator, a benchmark to watch, or a display-only reference. For the full scoring policy, see the BenchLM methodology page.

Questions

What does CritPt measure?

An Artificial Analysis metric for research-level physics reasoning.

Which model scores highest on CritPt?

GPT-5.6 Sol by OpenAI currently leads with a score of 32.3% on CritPt.

How many models are evaluated on CritPt?

199 AI models have been evaluated on CritPt on BenchLM.

Last updated: September 27, 2026 · BenchLM version CritPt 2026

Know when it’s worth switching models

The model to choose, the cheaper alternative, and the release we would wait on.

Read a sample issue

Join 2,000+ readers.

One email each week. Unsubscribe anytime.