Skip to main content
BenchLM
Data

Compare AI Models

783 models · 646 benchmarks

Pick two candidates and inspect one aligned evidence record. Scores, pricing, coverage, and decision notes stay side by side.

Step 1: Pick Model AStep 2: Pick Model B

Product comparisons

Choosing between the apps, not two model versions? These pages compare the products: the flagship models behind each one, API prices, subscriptions and who each suits.

Popular Comparisons

Gemini 4 ArgonvsGPT-6 Astra

83.36 vs 84.77

Gemini 4 ArgonvsClaude Opus 5.5

83.36 vs 86.37

Gemini 4 ArgonvsGemini 3.8 Flash

83.36 vs 73.16

Claude Opus 5.5vsClaude Sonnet 5.5

86.37 vs 83.87

Claude Opus 5.5vsGPT-6 Astra

86.37 vs 84.77

Claude Opus 5.5vsGPT-6.1 Sol

86.37 vs 81.44

Claude Opus 5.5vsGPT-6 Sol

86.37 vs 75.39

Claude Sonnet 5.5vsGPT-6.1 Sol

83.87 vs 81.44

Claude Sonnet 5.5vsGPT-6 Sol

83.87 vs 75.39

Claude Sonnet 5.5vsGemini 3.8 Flash

83.87 vs 73.16

GPT-6.1 SolvsGPT-6 Sol

81.44 vs 75.39

GPT-6.1 SolvsGPT-6 Astra

81.44 vs 84.77

GPT-6.1 SolvsGPT-6 Luna

81.44 vs 65.64

GPT-6 SolvsGPT-5.6 Sol

75.39 vs 77.93

GPT-6 SolvsGPT-6 Luna

75.39 vs 65.64

GPT-6 LunavsGPT-5.6 Luna

65.64 vs 66.03

GPT-6 LunavsGemini 3.8 Flash

65.64 vs 73.16

GPT-6 LunavsClaude Sonnet 5.5

65.64 vs 83.87

MiMo-V2.6-ProvsMiMo-V2.6-Flash

74.13 vs 65.33

MiMo-V2.6-ProvsGPT-6.1 Sol

74.13 vs 81.44

MiMo-V2.6-ProvsClaude Sonnet 5.5

74.13 vs 83.87

MiMo-V2.6-ProvsDeepSeek V4.1 Flash

74.13 vs 67.72

MiMo-V2.6-ProvsKimi K3

74.13 vs 70.67

MiMo-V2.6-FlashvsGPT-6 Luna

65.33 vs 65.64

MiMo-V2.6-FlashvsGemini 3.8 Flash

65.33 vs 73.16

MiMo-V2.6-FlashvsDeepSeek V4.1 Flash

65.33 vs 67.72

MiMo-V2.6-FlashvsQwen3.7 Max

65.33 vs 62.51

Grok 4.7vsGrok 4.6

— vs 67.89

Grok 4.7vsGPT-6 Sol

— vs 75.39

Grok 4.7vsGPT-6.1 Sol

— vs 81.44

Grok 4.7vsClaude Sonnet 5.5

— vs 83.87

Grok 4.7vsGemini 3.8 Flash

— vs 73.16

Perplexity Decider v1 27BvsJev 1.13.0

— vs —

Claude Opus 5.5vsClaude Opus 5

86.37 vs 79.36

Claude Sonnet 5.5vsClaude Sonnet 5

83.87 vs 65.96

Claude Fable 5.1vsGPT-6 Astra

81.74 vs 84.77

GPT-6 AstravsGPT-5.6 Sol

84.77 vs 77.93

Claude Fable 5.1vsClaude Opus 5

81.74 vs 79.36

GPT-6 AstravsClaude Opus 5

84.77 vs 79.36

Claude Fable 5.1vsClaude Fable 5

81.74 vs 78.82

Gemini 3.8 FlashvsGPT-6 Astra

73.16 vs 84.77

Gemini 3.8 FlashvsGemini 3.7 Flash

73.16 vs 67.58

Grok 4.6vsGPT-5.6 Sol

67.89 vs 77.93

DeepSeek V4.1 FlashvsDeepSeek V4 Pro 0813

67.72 vs 63.86

DeepSeek V4.1 FlashvsGLM-5.3

67.72 vs 68.61

GLM-5.3vsKimi K3

68.61 vs 70.67

Claude Opus 5vsGPT-5.6 Sol

79.36 vs 77.93

GPT-5.6 SolvsClaude Sonnet 5

77.93 vs 65.96

Kimi K3vsGPT-5.6 Sol

70.67 vs 77.93

GPT-5.6 SolvsClaude Opus 4.8

77.93 vs 69.07

GPT-5.6 TerravsGemini 3.5 Flash

72.3 vs 62.44

GPT-5.6 LunavsGemini 3.5 Flash

66.03 vs 62.44

Gemini 3.7 FlashvsGemini 3.6 Flash

67.58 vs 63.18

Gemini 3.6 FlashvsGemini 3.5 Flash

63.18 vs 62.44

Gemini 3.5 Flash-LitevsGemini 3.1 Flash-Lite

50.77 vs 48.04

Claude Sonnet 5vsClaude Opus 4.8

65.96 vs 69.07

Claude Opus 4.8vsGPT-5.5

69.07 vs 67.74

Claude Opus 4.8vsClaude Opus 4.7 (Adaptive)

69.07 vs 67.92

Gemini 3.5 FlashvsGPT-5.5

62.44 vs 67.74

Gemini 3.5 FlashvsClaude Opus 4.7

62.44 vs 64.13

Gemini 3.5 FlashvsGemini 3.1 Pro

62.44 vs 64.57

GPT-5.5vsClaude Opus 4.7

67.74 vs 64.13

GPT-5.5vsClaude Opus 4.7 (Adaptive)

67.74 vs 67.92

GPT-5.5vsClaude Fable 5

67.74 vs 78.82

GPT-5.5vsClaude Mythos 5

67.74 vs —

GPT-5.5vsGemini 3.1 Pro

67.74 vs 64.57

GPT-5.5vsGemini 3.1 Flash-Lite

67.74 vs 48.04

GPT-5.5vsGLM-5.2

67.74 vs 61.47

GPT-5.5vsGLM-5.1

67.74 vs 56.13

GPT-5.5vsKimi K2.7 Code

67.74 vs 52.25

GPT-5.5 ProvsClaude Opus 4.7

72.48 vs 64.13

Claude Opus 4.7vsGemini 3.1 Pro

64.13 vs 64.57

GLM-5 (Reasoning)vsGPT-5.5

— vs 67.74

GLM-5.2vsKimi K2.7 Code

61.47 vs 52.25

GLM-5.1vsKimi K2.7 Code

56.13 vs 52.25

Ling 2.6 FlashvsKimi K2.7 Code

32.56 vs 52.25

Ling 2.6 FlashvsGPT-5.5

32.56 vs 67.74

Ling 2.6 FlashvsGLM-5.1

32.56 vs 56.13

Ling 2.6 FlashvsClaude Opus 4.7

32.56 vs 64.13

Qwen3.6-27BvsQwen3.6-35B-A3B

47.86 vs 43.36

Qwen3.6-27BvsQwen3.5-27B

47.86 vs 48.23

Qwen3.6-27BvsGemma 4 31B

47.86 vs 40.44

Claude Mythos 5vsGPT-5.5 Pro

— vs 72.48

Claude Mythos 5vsClaude Opus 4.7

— vs 64.13

Claude Fable 5vsClaude Opus 4.8

78.82 vs 69.07

Claude 3.5 SonnetvsGrok 4

28.38 vs 52

GPT-4ovsGrok 4.1

29.74 vs —

Gemini 2.5 Provso3

49.43 vs 45.94

Kimi K2.7 CodevsKimi K2.6

52.25 vs 58.65

Claude Opus 4.7vsGrok 4.20

64.13 vs 57.32

GPT-4ovsGrok 4

29.74 vs 52

Claude 4.1 Opus ThinkingvsGrok 4

39.93 vs 52

Claude Opus 4.7vsGrok 4.1 Fast

64.13 vs 36.4

Gemini 3.1 ProvsGrok 3 [Beta]

64.57 vs 42.7

Claude 4 SonnetvsGrok 4

38.42 vs 52

Claude Opus 4.7vsGPT-4o

64.13 vs 29.74

Questions

How do I compare two AI models?

Pick any two models above to see them side-by-side across 646 benchmarks, plus pricing, speed and context window. Popular pairs are linked below the picker.

What is the best AI model comparison tool?

BenchLM compares 783 models across 646 sourced benchmarks, updated with every release — every score links to its original source.

Can I compare ChatGPT, Claude and Gemini?

Yes — any pair, e.g. Claude Opus 5 vs GPT-5.6. For the three-way breakdown see ChatGPT vs Claude vs Gemini.

How often is the comparison data updated?

On every model release and benchmark ingest; see latest model releases.