Skip to main content
BenchLM

Compare AI Models

507 models · 117 benchmarks

Pick two candidates and inspect one aligned evidence record. Scores, pricing, coverage, and decision notes stay side by side.

Step 1: Pick Model AStep 2: Pick Model B

Product comparisons

Choosing between the apps, not two model versions? These pages compare the products: the flagship models behind each one, API prices, subscriptions and who each suits.

Popular Comparisons

Claude Opus 5.5vsClaude Opus 5

88.45 vs 80.35

Claude Fable 5.1vsGPT-6 Astra

83.34 vs 88.47

GPT-6 AstravsGPT-5.6 Sol

88.47 vs 80.44

Claude Fable 5.1vsClaude Opus 5

83.34 vs 80.35

GPT-6 AstravsClaude Opus 5

88.47 vs 80.35

Claude Fable 5.1vsClaude Fable 5

83.34 vs 79.53

Gemini 3.8 FlashvsGPT-6 Astra

72.74 vs 88.47

Gemini 3.8 FlashvsGemini 3.7 Flash

72.74 vs 65.31

Grok 4.6vsGPT-5.6 Sol

69.23 vs 80.44

DeepSeek V4.1 FlashvsDeepSeek V4 Pro 0813

— vs 63.49

DeepSeek V4.1 FlashvsGLM-5.3

— vs 65.55

GLM-5.3vsKimi K3

65.55 vs 72.53

Claude Opus 5vsGPT-5.6 Sol

80.35 vs 80.44

GPT-5.6 SolvsClaude Sonnet 5

80.44 vs 67.25

Kimi K3vsGPT-5.6 Sol

72.53 vs 80.44

GPT-5.6 SolvsClaude Opus 4.8

80.44 vs 70.86

GPT-5.6 TerravsGemini 3.5 Flash

72.76 vs 63.93

GPT-5.6 LunavsGemini 3.5 Flash

64.87 vs 63.93

Gemini 3.7 FlashvsGemini 3.6 Flash

65.31 vs 65.06

Gemini 3.6 FlashvsGemini 3.5 Flash

65.06 vs 63.93

Gemini 3.5 Flash-LitevsGemini 3.1 Flash-Lite

51.32 vs 47.46

Claude Sonnet 5vsClaude Opus 4.8

67.25 vs 70.86

Claude Opus 4.8vsGPT-5.5

70.86 vs 69.48

Claude Opus 4.8vsClaude Opus 4.7 (Adaptive)

70.86 vs 68.83

Gemini 3.5 FlashvsGPT-5.5

63.93 vs 69.48

Gemini 3.5 FlashvsClaude Opus 4.7

63.93 vs 66.35

Gemini 3.5 FlashvsGemini 3.1 Pro

63.93 vs 64.97

GPT-5.5vsClaude Opus 4.7

69.48 vs 66.35

GPT-5.5vsClaude Opus 4.7 (Adaptive)

69.48 vs 68.83

GPT-5.5vsClaude Fable 5

69.48 vs 79.53

GPT-5.5vsClaude Mythos 5

69.48 vs —

GPT-5.5vsGemini 3.1 Pro

69.48 vs 64.97

GPT-5.5vsGemini 3.1 Flash-Lite

69.48 vs 47.46

GPT-5.5vsGLM-5.2

69.48 vs 62.5

GPT-5.5vsGLM-5.1

69.48 vs 57.71

GPT-5.5vsKimi K2.7 Code

69.48 vs 50.42

GPT-5.5 ProvsClaude Opus 4.7

73.04 vs 66.35

Claude Opus 4.7vsGemini 3.1 Pro

66.35 vs 64.97

GLM-5 (Reasoning)vsGPT-5.5

— vs 69.48

GLM-5.2vsKimi K2.7 Code

62.5 vs 50.42

GLM-5.1vsKimi K2.7 Code

57.71 vs 50.42

Ling 2.6 FlashvsKimi K2.7 Code

33.71 vs 50.42

Ling 2.6 FlashvsGPT-5.5

33.71 vs 69.48

Ling 2.6 FlashvsGLM-5.1

33.71 vs 57.71

Ling 2.6 FlashvsClaude Opus 4.7

33.71 vs 66.35

Qwen3.6-27BvsQwen3.6-35B-A3B

46.27 vs 41.55

Qwen3.6-27BvsQwen3.5-27B

46.27 vs 43.82

Qwen3.6-27BvsGemma 4 31B

46.27 vs 44.85

Claude Mythos 5vsGPT-5.5 Pro

— vs 73.04

Claude Mythos 5vsClaude Opus 4.7

— vs 66.35

Claude Fable 5vsClaude Opus 4.8

79.53 vs 70.86

Claude 3.5 SonnetvsGrok 4

29.76 vs 52.71

GPT-4ovsGrok 4.1

30.68 vs —

Gemini 2.5 Provso3

50.44 vs 47.01

Kimi K2.7 CodevsKimi K2.6

50.42 vs 59.85

Claude Opus 4.7vsGrok 4.20

66.35 vs 59.56

GPT-4ovsGrok 4

30.68 vs 52.71

Claude 4.1 Opus ThinkingvsGrok 4

36.6 vs 52.71

Claude Opus 4.7vsGrok 4.1 Fast

66.35 vs 36.32

Gemini 3.1 ProvsGrok 3 [Beta]

64.97 vs 45.04

Claude 4 SonnetvsGrok 4

36.06 vs 52.71

Claude Opus 4.7vsGPT-4o

66.35 vs 30.68

Questions

How do I compare two AI models?

Pick any two models above to see them side-by-side across 117 benchmarks, plus pricing, speed and context window. Popular pairs are linked below the picker.

What is the best AI model comparison tool?

BenchLM compares 507 models across 117 sourced benchmarks, updated with every release — every score links to its original source.

Can I compare ChatGPT, Claude and Gemini?

Yes — any pair, e.g. Claude Opus 5 vs GPT-5.6. For the three-way breakdown see ChatGPT vs Claude vs Gemini.

How often is the comparison data updated?

On every model release and benchmark ingest; see latest model releases.