Skip to main content

Benchmark profile

Artificial Analysis SciCode (AA-SciCode)

A display-only Artificial Analysis SciCode score.

Data verified

Benchmark score on AA-SciCode — July 29, 2026

BenchLM mirrors the published score view for AA-SciCode. Claude Fable 5 leads the public snapshot at 60.2% , followed by Gemini 3.1 Pro (58.9%) and Kimi K3 (58.7%). BenchLM does not use these results to rank models overall.

163 modelsCodingCurrentDisplay onlyUpdated July 29, 2026

Benchmark score table (163 models)

Score
1
Claude Fable 5Anthropic · Closed
60.2%
2
Gemini 3.1 ProGoogle · Closed
58.9%
3
Kimi K3Moonshot AI · Closed
58.7%
4
Muse Spark 1.1Meta · Closed
58.2%
5
GPT-5.4OpenAI · Closed
56.6%
6
GPT-5.6 SolOpenAI · Closed
56.1%
7
GPT-5.5OpenAI · Closed
56.1%
8
Gemini 3 ProGoogle · Closed
56.1%
9
Claude Opus 5Anthropic · Closed
55.7%
10
GPT-5.2-CodexOpenAI · Closed
54.6%
11
Claude Opus 4.7 (Adaptive)Anthropic · Closed
54.5%
12
Grok 4.5xAI · Closed
54.1%
13
GPT-5.6 TerraOpenAI · Closed
53.9%
14
Claude Sonnet 5Anthropic · Closed
53.6%
15
Claude Opus 4.8Anthropic · Closed
53.5%
16
Kimi K2.6Moonshot AI · Open weight
53.5%
17
GPT-5.3 CodexOpenAI · Closed
53.2%
18
GPT-5.3-Codex-SparkOpenAI · Closed
53.2%
19
Gemini 3.5 FlashGoogle · Closed
53.1%
20
Gemini 3.6 FlashGoogle · Closed
52.7%
21
GPT-5.6 LunaOpenAI · Closed
52.5%
22
GPT-5.2OpenAI · Closed
52.1%
23
Claude Opus 4.6 (Adaptive)Anthropic · Closed
51.9%
24
Muse SparkMeta · Closed
51.5%
25
GLM-5.2Z.AI · Open weight
50.5%
26
MiMo-V2.5-ProXiaomi · Closed
50.2%
27
Claude Opus 4.7Anthropic · Closed
50.1%
28
DeepSeek V4 Pro (Max)DeepSeek · Open weight
50.0%
29
GPT-5.4 miniOpenAI · Closed
49.9%
30
Gemini 3 FlashGoogle · Closed
49.9%
31
Claude Opus 4.5 ThinkingAnthropic · Closed
49.5%
32
Kimi K2.5Moonshot AI · Open weight
49.0%
33
Kimi K2.5 (Reasoning)Moonshot AI · Closed
49.0%
34
Qwen3.7 MaxAlibaba · Closed
48.8%
35
Hy3 PreviewTencent · Open weight
47.6%
36
Hy3Tencent · Open weight
47.6%
37
Kimi K2.7 CodeMoonshot AI · Open weight
47.5%
38
Grok 4.3xAI · Closed
47.3%
39
Claude Opus 4.5Anthropic · Closed
47.0%
40
MiniMax M2.7MiniMax · Open weight
47.0%
41
Claude Sonnet 4.6Anthropic · Closed
46.9%
42
GPT-5.4 nanoOpenAI · Closed
46.9%
43
Qwen 3.6 Max (preview)Alibaba · Closed
46.9%
44
DeepSeek V4 Pro (High)DeepSeek · Open weight
46.4%
45
GLM-5Z.AI · Open weight
46.2%
46
InklingThinking Machines Lab · Open weight
46.1%
47
Claude Opus 4.6Anthropic · Closed
45.7%
48
Grok 4xAI · Closed
45.7%
49
Qwen3.7 PlusAlibaba · Closed
45.5%
50
MiniMax M3MiniMax · Open weight
45.4%
51
GLM-4.7Z.AI · Open weight
45.1%
52
DeepSeek V4 Flash (Max)DeepSeek · Open weight
44.9%
53
44.2%
54
44.2%
55
GLM-5.1Z.AI · Open weight
43.8%
56
GLM-5-TurboZ.AI · Closed
43.6%
57
GLM-5V-TurboZ.AI · Closed
43.5%
58
Gemma 4 31BGoogle · Open weight
43.4%
59
GPT-5.1OpenAI · Closed
43.3%
60
GPT-5 (high)OpenAI · Closed
42.9%
61
Gemini 2.5 ProGoogle · Closed
42.8%
62
MiniMax M2.5MiniMax · Closed
42.6%
63
MiMo-V2-ProXiaomi · Closed
42.5%
64
Qwen3.5 397BAlibaba · Open weight
42.0%
65
Qwen3.5-122B-A10BAlibaba · Open weight
42.0%
66
DeepSeek V4 Flash (High)DeepSeek · Open weight
42.0%
67
Qwen3.5 397B (Reasoning)Alibaba · Open weight
42.0%
68
Gemini 3.1 Flash-LiteGoogle · Closed
41.9%
69
GPT-5 (medium)OpenAI · Closed
41.1%
70
o3OpenAI · Closed
41.0%
71
Gemini 3.5 Flash-LiteGoogle · Closed
40.9%
72
Claude 4.1 Opus ThinkingAnthropic · Closed
40.9%
73
Qwen3.6 PlusAlibaba · Closed
40.7%
74
GPT-4.1 miniOpenAI · Closed
40.4%
75
DeepSeek-R1DeepSeek · Open weight
40.3%
76
GPT-5.1-Codex-MaxOpenAI · Closed
40.2%
77
GPT-5.1-CodexOpenAI · Closed
40.2%
78
Step 3.7 FlashStepFun · Open weight
40.0%
79
Gemma 4 26B A4BGoogle · Open weight
40.0%
80
Nemotron 3 UltraNVIDIA · Open weight
39.9%
81
o3-miniOpenAI · Closed
39.9%
82
Qwen3.6-27BAlibaba · Open weight
39.8%
83
Mistral Medium 3.5 128BMistral · Open weight
39.6%
84
Qwen3.5-27BAlibaba · Open weight
39.5%
85
GPT-5 miniOpenAI · Closed
39.2%
86
DeepSeek V3.1 (Reasoning)DeepSeek · Open weight
39.1%
87
GPT-OSS 120BOpenAI · Open weight
38.9%
88
DeepSeek V3.2DeepSeek · Open weight
38.7%
89
Mercury 2Inception · Closed
38.7%
90
Step 3.5 FlashStepFun · Open weight
38.5%
91
Qwen3 MaxAlibaba · Closed
38.3%
92
Gemma 4 12BGoogle · Open weight
38.2%
93
GPT-4.1OpenAI · Closed
38.1%
94
Mistral Small 4Mistral · Open weight
38.0%
95
Mistral Small 4 (Reasoning)Mistral · Open weight
38.0%
96
Command A+Cohere · Open weight
37.8%
97
Qwen3.5-35B-A3BAlibaba · Open weight
37.7%
98
DeepSeek R1 Distill Qwen 32BDeepSeek · Open weight
37.6%
99
MiniMax M1 80kMiniMax · Closed
37.4%
100
Claude 4 SonnetAnthropic · Closed
37.3%
101
MiMo-V2-OmniXiaomi · Closed
36.7%
102
DeepSeek V3.1DeepSeek · Open weight
36.7%
103
GPT-5 nanoOpenAI · Closed
36.6%
104
Mistral Large 3Mistral · Closed
36.2%
105
Grok Code Fast 1xAI · Closed
36.2%
106
Trinity-Large-PreviewArcee AI · Open weight
36.1%
107
Trinity-Large-ThinkingArcee AI · Open weight
36.1%
108
Nemotron 3 Super 120B A12BNVIDIA · Open weight
36.0%
109
Qwen3.6-35B-A3BAlibaba · Open weight
35.8%
110
o1OpenAI · Closed
35.8%
111
K-ExaoneLG AI Research · Closed
35.6%
112
DeepSeek V3DeepSeek · Open weight
35.4%
113
Nemotron Ultra 253BNVIDIA · Open weight
34.7%
114
Kimi K2Moonshot AI · Closed
34.5%
115
GPT-OSS 20BOpenAI · Open weight
34.4%
116
GLM-4.7-FlashZ.AI · Open weight
33.7%
117
GPT-4oOpenAI · Closed
33.3%
118
GLM-4.6Z.AI · Open weight
33.1%
119
Llama 4 MaverickMeta · Open weight
33.1%
120
Mistral Medium 3Mistral · Closed
33.1%
121
GPT-4 TurboOpenAI · Closed
31.9%
122
GLM-4.5-AirZ.AI · Closed
30.6%
123
Llama 3.1 405BMeta · Open weight
29.9%
124
Grok 4.1 FastxAI · Closed
29.6%
125
Nemotron 3 Nano 30BNVIDIA · Open weight
29.6%
126
Gemini 1.5 ProGoogle · Closed
29.5%
127
Mistral Large 2Mistral · Closed
29.2%
128
Gemini 2.5 FlashGoogle · Closed
29.1%
129
Nemotron 3 Nano Omni 30B A3BNVIDIA · Open weight
27.8%
130
Ling 2.6 FlashInclusionAI · Open weight
27.1%
131
Qwen2.5 Coder 32B InstructAlibaba · Open weight
27.1%
132
Sarvam 105BSarvam · Open weight
26.4%
133
Phi-4Microsoft · Open weight
26.0%
134
MiMo-V2-FlashXiaomi · Open weight
25.9%
135
GPT-4.1 nanoOpenAI · Closed
25.9%
136
Exaone 4.0 32BLG AI Research · Open weight
25.2%
137
Solar Pro 2Upstage · Closed
24.8%
138
Gemma 4 E4BGoogle · Open weight
24.4%
139
Ministral 3 14B (Reasoning)Mistral · Open weight
23.6%
140
Ministral 3 14BMistral · Open weight
23.6%
141
Claude 3 OpusAnthropic · Closed
23.3%
142
GPT-4o miniOpenAI · Closed
22.9%
143
Gemma 3 27BGoogle · Open weight
21.2%
144
Gemma 4 E2BGoogle · Open weight
20.9%
145
Nova ProAmazon · Closed
20.8%
146
Ministral 3 8B (Reasoning)Mistral · Open weight
20.8%
147
Ministral 3 8BMistral · Open weight
20.8%
148
Sarvam 30BSarvam · Open weight
19.2%
149
Claude 3 HaikuAnthropic · Closed
18.6%
150
Llama 4 ScoutMeta · Open weight
17.0%
151
Ministral 3 3B (Reasoning)Mistral · Open weight
14.4%
152
Ministral 3 3BMistral · Open weight
14.4%
153
Gemini 1.0 ProGoogle · Closed
11.7%
154
LFM2-24B-A2BLiquidAI · Closed
10.9%
155
Granite-4.0-1BIBM · Open weight
8.7%
156
Granite-4.0-H-1BIBM · Open weight
8.2%
157
LFM2.5-8B-A1BLiquidAI · Open weight
7.8%
158
Exaone 4.0 1.2BLG AI Research · Open weight
7.4%
159
LFM2.5-1.2B-ThinkingLiquidAI · Closed
4.2%
160
LFM2.5-VL-1.6B-ExtractLiquidAI · Open weight
3.0%
161
LFM2.5-1.2B-InstructLiquidAI · Closed
2.3%
162
Granite-4.0-H-350MIBM · Open weight
1.7%
163
Granite-4.0-350MIBM · Open weight
0.9%

The published AA-SciCode snapshot places Claude Fable 5 first at 60.2%. The third row is 1.5 points behind. The broader top-10 range is 5.6 points, so many of the published results sit in a relatively narrow band.

163 models have been evaluated on AA-SciCode. The benchmark falls in the Coding category. This category carries a 20% weight in BenchLM.ai's overall scoring system. AA-SciCode is currently displayed for reference but excluded from the scoring formula, so it does not directly affect overall rankings.

About AA-SciCode

Year

2026

Tasks

Scientific coding subproblems

Format

Task success rate

Difficulty

Scientific programming

BenchLM stores the Artificial Analysis SciCode result separately from the weighted SciCode lane so AA refreshes remain display-only.

BenchLM freshness & provenance

Version

AA-SciCode 2026

Refresh cadence

Quarterly

Staleness state

Current

Question availability

Public benchmark set

CurrentDisplay only

BenchLM uses freshness metadata to decide whether a benchmark should still be treated as a strong differentiator, a benchmark to watch, or a display-only reference. For the full scoring policy, see the BenchLM methodology page.

FAQ

What does AA-SciCode measure?

A display-only Artificial Analysis SciCode score.

Which model scores highest on AA-SciCode?

Claude Fable 5 by Anthropic currently leads with a score of 60.2% on AA-SciCode.

How many models are evaluated on AA-SciCode?

163 AI models have been evaluated on AA-SciCode on BenchLM.

Last updated: July 29, 2026 · BenchLM version AA-SciCode 2026

Know when it’s worth switching models

The model to choose, the cheaper alternative, and the release we would wait on.

Read a sample issue

Join 2,000+ readers.

One email each week. Unsubscribe anytime.