# LisanBench

> A word-chain reasoning benchmark that tests planning, recall, constraint following, and vocabulary depth by asking models to extend non-repeating edit-distance-1 chains.

Canonical page: https://benchlm.ai/benchmarks/lisanbench

- Category: [Reasoning](/reasoning)
- Last updated: September 23, 2026 snapshot

## About LisanBench

- Year: 2026
- Tasks: 50 starting words × 3 trials
- Format: Difficulty-weighted word-chain reasoning
- Difficulty: Open-ended lexical planning
- Paper: [LisanBench methodology](https://lisanbench.com/?tab=about)

BenchLM mirrors the public difficulty-weighted LisanBench leaderboard as a display-only reasoning benchmark. The public benchmark currently evaluates 128 model variants across 50 starting words with 3 trials per word.

LisanBench is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (154 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Claude Opus 4.7 (Adaptive)](/models/claude-opus-4-7-adaptive) | Anthropic | 5122.60 |
| 2 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 5068.25 |
| 3 | [Claude Fable 5](/models/claude-fable) | Anthropic | 4561.82 |
| 4 | [Claude Opus 4.6 (Adaptive)](/models/claude-opus-4-6-thinking) | Anthropic | 3526.49 |
| 5 | [Kimi K3](/models/kimi-k3) | Moonshot AI | 3525.77 |
| 6 | [GPT-5.5](/models/gpt-5-5) | OpenAI | 3315.52 |
| 7 | [Claude Sonnet 4.6](/models/claude-sonnet-4-6) | Anthropic | 2944.27 |
| 8 | [GPT-5.4](/models/gpt-5-4) | OpenAI | 2738.16 |
| 9 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 2693.67 |
| 10 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 2270.40 |
| 11 | [Claude Opus 4.5 Thinking](/models/claude-opus-4-5-thinking) | Anthropic | 2204.43 |
| 12 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | Google | 1929.11 |
| 13 | [Grok 4](/models/grok-4) | xAI | 1778.40 |
| 14 | [Claude Sonnet 5](/models/claude-sonnet-5) | Anthropic | 1736.56 |
| 15 | [o3](/models/o3) | OpenAI | 1523.00 |
| 16 | [Deepseek V3.2 Speciale (thinking)](https://lisanbench.com/?tab=leaderboard&models=deepseek-v3.2-speciale%3Athinking) | DeepSeek | 1510.70 |
| 17 | [Grok 4.20](/models/grok-4-20-beta) | xAI | 1464.63 |
| 18 | [GPT-5.2](/models/gpt-5-2) | OpenAI | 1458.80 |
| 19 | [GPT-5 (medium)](/models/gpt-5-medium) | OpenAI | 1457.28 |
| 20 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 1403.28 |
| 21 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 1196.90 |
| 22 | [Gemini 3 Pro](/models/gemini-3-pro) | Google | 1130.63 |
| 23 | [Gemini 3.5 Flash](/models/gemini-3-5-flash) | Google | 1128.26 |
| 24 | [Claude Sonnet 4.5 Thinking](/models/claude-sonnet-4-5-thinking) | Anthropic | 1090.82 |
| 25 | [DeepSeek V4 Flash 0731](/models/deepseek-v4-flash-0731) | DeepSeek | 1063.47 |
| 26 | [DeepSeek V4 Pro 0813](/models/deepseek-v4-pro-0813) | DeepSeek | 1059.51 |
| 27 | [DeepSeek V3.2 (Thinking)](/models/deepseek-v3-2-thinking) | DeepSeek | 925.31 |
| 28 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | Google | 872.67 |
| 29 | [Step 3.5 Flash](/models/step-3-5-flash) | StepFun | 811.21 |
| 30 | [Grok 4 Fast (Reasoning)](/models/grok-4-fast-reasoning) | xAI | 806.48 |
| 31 | [GPT-5 mini](/models/gpt-5-mini) | OpenAI | 758.84 |
| 32 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 648.18 |
| 33 | [Kimi K2.5 (Reasoning)](/models/kimi-k2-5-reasoning) | Moonshot AI | 641.96 |
| 34 | [Kimi K2](/models/kimi-k2) | Moonshot AI | 633.05 |
| 35 | [GPT-5 nano](/models/gpt-5-nano) | OpenAI | 626.86 |
| 36 | [Grok 4.1 Fast (Reasoning)](/models/grok-4-1-fast-reasoning) | xAI | 604.43 |
| 37 | [Sonnet 4 (16k)](https://lisanbench.com/?tab=leaderboard&models=claude-sonnet-4%3Athinking-16k) | Anthropic | 602.95 |
| 38 | [GLM-5.2](/models/glm-5-2) | Z.AI | 591.99 |
| 39 | [Gemini 3 Flash](/models/gemini-3-flash) | Google | 591.88 |
| 40 | [GPT-5.4 mini](/models/gpt-5-4-mini) | OpenAI | 591.48 |
| 41 | [GPT-5.4 nano](/models/gpt-5-4-nano) | OpenAI | 543.21 |
| 42 | [o3-mini](/models/o3-mini) | OpenAI | 518.37 |
| 43 | [Doubao Seed 2.0 Pro (thinking)](https://lisanbench.com/?tab=leaderboard&models=doubao-seed-2.0-pro%3Athinking) | StepFun | 456.93 |
| 44 | [GPT-OSS 120B](/models/gpt-oss-120b) | OpenAI | 448.33 |
| 45 | [Qwen3.5 397B (Reasoning)](/models/qwen3-5-397b-reasoning) | Alibaba | 387.74 |
| 46 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 366.79 |
| 47 | [o4-mini (high)](/models/o4-mini-high) | OpenAI | 352.68 |
| 48 | [GLM-5 (Reasoning)](/models/glm-5-reasoning) | Z.AI | 336.34 |
| 49 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 332.46 |
| 50 | [GPT-5.5](/models/gpt-5-5) | OpenAI | 305.30 |
| 51 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 270.10 |
| 52 | [Doubao Seed 2.0 Lite (thinking)](https://lisanbench.com/?tab=leaderboard&models=doubao-seed-2.0-lite%3Athinking) | StepFun | 265.12 |
| 53 | [Opus 4](https://lisanbench.com/?tab=leaderboard&models=claude-opus-4) | Anthropic | 262.56 |
| 54 | [Doubao Seed 1.8 (thinking)](https://lisanbench.com/?tab=leaderboard&models=doubao-seed-1.8%3Athinking) | StepFun | 255.84 |
| 55 | [MiniMax M2.5](/models/minimax-m2-5) | MiniMax | 228.38 |
| 56 | [Qwen3 235B 2507 (Reasoning)](/models/qwen3-235b-2507-reasoning) | Alibaba | 226.22 |
| 57 | [Claude Opus 4.7](/models/claude-opus-4-7) | Anthropic | 217.52 |
| 58 | [Claude 4.1 Opus](/models/claude-4-1-opus) | Anthropic | 215.66 |
| 59 | [Claude Sonnet 4.6](/models/claude-sonnet-4-6) | Anthropic | 208.64 |
| 60 | [Claude Sonnet 5](/models/claude-sonnet-5) | Anthropic | 208.26 |
| 61 | [Gemini 2.5 Pro](/models/gemini-2-5-pro) | Google | 197.43 |
| 62 | [Grok 3 Mini](/models/grok-3-mini) | xAI | 194.03 |
| 63 | [Grok 3 [Beta]](/models/grok-3-beta) | xAI | 188.12 |
| 64 | [Sonnet 3.7](https://lisanbench.com/?tab=leaderboard&models=claude-3.7-sonnet) | Anthropic | 162.44 |
| 65 | [GPT-OSS 20B](/models/gpt-oss-20b) | OpenAI | 156.99 |
| 66 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 156.14 |
| 67 | [Doubao Seed 2.0 Mini (thinking)](https://lisanbench.com/?tab=leaderboard&models=doubao-seed-2.0-mini%3Athinking) | StepFun | 150.35 |
| 68 | [Claude 4 Sonnet](/models/claude-4-sonnet) | Anthropic | 150.17 |
| 69 | [Claude 3.5 Sonnet](/models/claude-3-5-sonnet) | Anthropic | 149.65 |
| 70 | [Claude 3.5 Sonnet](/models/claude-3-5-sonnet) | Anthropic | 129.73 |
| 71 | [Gemini 1.5 Pro](/models/gemini-1-5-pro) | Google | 119.72 |
| 72 | [DeepSeek V3.2](/models/deepseek-v3-2) | DeepSeek | 119.04 |
| 73 | [DeepSeek V4 Pro 0813](/models/deepseek-v4-pro-0813) | DeepSeek | 117.14 |
| 74 | [Gemini 2.5 Flash](/models/gemini-2-5-flash) | Google | 112.75 |
| 75 | [DeepSeek-R1](/models/deepseek-r1) | DeepSeek | 111.60 |
| 76 | [Qwen3.5-122B-A10B](/models/qwen3-5-122b-a10b) | Alibaba | 109.62 |
| 77 | [GPT-5.4](/models/gpt-5-4) | OpenAI | 109.51 |
| 78 | [GLM-4.5](/models/glm-4-5) | Z.AI | 108.32 |
| 79 | [Qwen3.5-35B-A3B](/models/qwen3-5-35b-a3b) | Alibaba | 107.61 |
| 80 | [Olmo 3 32B (thinking)](https://lisanbench.com/?tab=leaderboard&models=olmo-3-32b-think) | Allen AI | 104.86 |
| 81 | [Claude Sonnet 4.5](/models/claude-sonnet-4-5) | Anthropic | 103.58 |
| 82 | [DeepSeek V3](/models/deepseek-v3) | DeepSeek | 103.39 |
| 83 | [O1 Mini (medium)](https://lisanbench.com/?tab=leaderboard&models=o1-mini) | OpenAI | 103.10 |
| 84 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 96.63 |
| 85 | [GPT-4o](/models/gpt-4o) | OpenAI | 94.16 |
| 86 | [Claude Opus 4.5](/models/claude-opus-4-5) | Anthropic | 93.49 |
| 87 | [Claude Opus 4.6](/models/claude-opus-4-6) | Anthropic | 91.61 |
| 88 | [GPT-4 Turbo](/models/gpt-4-turbo) | OpenAI | 91.48 |
| 89 | [Kimi K2](/models/kimi-k2) | Moonshot AI | 85.92 |
| 90 | [Qwen3 4B (16k)](https://lisanbench.com/?tab=leaderboard&models=Qwen3-4B-FP8%3Athinking-16k) | Alibaba | 77.21 |
| 91 | [Claude 3 Opus](/models/claude-3-opus) | Anthropic | 75.77 |
| 92 | [Gemini 2.5 Flash](/models/gemini-2-5-flash) | Google | 72.17 |
| 93 | [MiniMax M1 80k](/models/minimax-m1-80k) | MiniMax | 66.71 |
| 94 | [GLM-5.2](/models/glm-5-2) | Z.AI | 64.50 |
| 95 | [Gemini 2.0 Flash](https://lisanbench.com/?tab=leaderboard&models=gemini-2.0-flash-001) | Google | 62.04 |
| 96 | [DeepSeek V4 Flash 0731](/models/deepseek-v4-flash-0731) | DeepSeek | 56.78 |
| 97 | [Horizon Beta](https://lisanbench.com/?tab=leaderboard&models=horizon-beta) | OpenRouter | 55.69 |
| 98 | [Gemini Flash 1.5](https://lisanbench.com/?tab=leaderboard&models=gemini-flash-1.5) | Google | 55.20 |
| 99 | [GLM-4.5-Air](/models/glm-4-5-air) | Z.AI | 54.86 |
| 100 | [Nova Pro](/models/nova-pro) | Amazon | 54.38 |
| 101 | [GLM-4.7](/models/glm-4-7) | Z.AI | 54.27 |
| 102 | [Polaris Alpha](https://lisanbench.com/?tab=leaderboard&models=polaris-alpha) | OpenRouter | 53.34 |
| 103 | [Claude Haiku 4.5](/models/claude-haiku-4-5) | Anthropic | 52.64 |
| 104 | [GPT 3.5 Turbo](https://lisanbench.com/?tab=leaderboard&models=gpt-3.5-turbo-0613) | OpenAI | 50.96 |
| 105 | [Qwen3 Coder](https://lisanbench.com/?tab=leaderboard&models=qwen3-coder) | Alibaba | 50.95 |
| 106 | [Llama 3.1 405B](/models/llama-3-1-405b) | Meta | 48.88 |
| 107 | [Grok 4.1 Fast](/models/grok-4-1-fast) | xAI | 47.29 |
| 108 | [GLM-4.6](/models/glm-4-6) | Z.AI | 44.20 |
| 109 | [Gemma 3 27B](/models/gemma-3-27b) | Google | 43.79 |
| 110 | [Mistral Medium 3](/models/mistral-medium-3) | Mistral | 43.31 |
| 111 | [GPT-5.4 mini](/models/gpt-5-4-mini) | OpenAI | 42.74 |
| 112 | [Llama 4 Maverick](/models/llama-4-maverick) | Meta | 42.33 |
| 113 | [GPT-4.1](/models/gpt-4-1) | OpenAI | 42.02 |
| 114 | [Ernie 4.5 300B A47B](https://lisanbench.com/?tab=leaderboard&models=ernie-4.5-300b-a47b) | Baidu | 40.99 |
| 115 | [Sherlock Dash Alpha](https://lisanbench.com/?tab=leaderboard&models=sherlock-dash-alpha) | OpenRouter | 40.07 |
| 116 | [Devstral Medium](https://lisanbench.com/?tab=leaderboard&models=devstral-medium) | Mistral AI | 40.03 |
| 117 | [Gemini 2.0 Flash Lite 001](https://lisanbench.com/?tab=leaderboard&models=gemini-2.0-flash-lite-001) | Google | 38.77 |
| 118 | [Haiku 3.5](https://lisanbench.com/?tab=leaderboard&models=claude-3-5-haiku-20241022) | Anthropic | 38.22 |
| 119 | [Gemini 2.5 Flash Lite](https://lisanbench.com/?tab=leaderboard&models=gemini-2.5-flash-lite) | Google | 38.21 |
| 120 | [Llama 3.1 70B](https://lisanbench.com/?tab=leaderboard&models=llama-3.1-70b-instruct) | Meta | 38.06 |
| 121 | [Qwen3 1.7B (16k)](https://lisanbench.com/?tab=leaderboard&models=Qwen3-1.7B-FP8%3Athinking-16k) | Alibaba | 38.06 |
| 122 | [Claude 3 Haiku](/models/claude-3-haiku) | Anthropic | 35.46 |
| 123 | [Mistral Large 2411](https://lisanbench.com/?tab=leaderboard&models=mistral-large-2411) | Mistral AI | 34.64 |
| 124 | [GPT-4.1 mini](/models/gpt-4-1-mini) | OpenAI | 32.82 |
| 125 | [Gemini 2.5 Flash Lite (16k)](https://lisanbench.com/?tab=leaderboard&models=gemini-2.5-flash-lite%3Athinking-16k) | Google | 32.37 |
| 126 | [Qwen3 235B A22B 2507](https://lisanbench.com/?tab=leaderboard&models=qwen3-235b-a22b-2507) | Alibaba | 31.92 |
| 127 | [Llama 4 Scout](/models/llama-4-scout) | Meta | 30.85 |
| 128 | [MiMo-V2-Flash](/models/mimo-v2-flash) | Xiaomi | 28.75 |
| 129 | [Nova Lite V1](https://lisanbench.com/?tab=leaderboard&models=nova-lite-v1) | Amazon | 25.24 |
| 130 | [Nova Micro V1](https://lisanbench.com/?tab=leaderboard&models=nova-micro-v1) | Amazon | 24.88 |
| 131 | [Gemini Flash 1.5 8B](https://lisanbench.com/?tab=leaderboard&models=gemini-flash-1.5-8b) | Google | 24.38 |
| 132 | [Qwen3 32B](https://lisanbench.com/?tab=leaderboard&models=qwen3-32b) | Alibaba | 23.86 |
| 133 | [Gemma 3 12B](https://lisanbench.com/?tab=leaderboard&models=gemma-3-12b-it) | Google | 21.56 |
| 134 | [GPT-4o mini](/models/gpt-4o-mini) | OpenAI | 21.21 |
| 135 | [Qwen3 30B A3B 2507](https://lisanbench.com/?tab=leaderboard&models=qwen3-30b-a3b-instruct-2507) | Alibaba | 18.98 |
| 136 | [Mistral Small 3.2 24B](https://lisanbench.com/?tab=leaderboard&models=mistral-small-3.2-24b-instruct) | Mistral AI | 17.77 |
| 137 | [Qwen3 14B](https://lisanbench.com/?tab=leaderboard&models=qwen3-14b) | Alibaba | 16.68 |
| 138 | [Qwen3 8B](https://lisanbench.com/?tab=leaderboard&models=Qwen3-8B-FP8) | Alibaba | 15.50 |
| 139 | [GPT-4.1 nano](/models/gpt-4-1-nano) | OpenAI | 14.95 |
| 140 | [Devstral Small](https://lisanbench.com/?tab=leaderboard&models=devstral-small) | Mistral AI | 13.22 |
| 141 | [Codestral 2508](https://lisanbench.com/?tab=leaderboard&models=codestral-2508) | Mistral AI | 13.15 |
| 142 | [Ministral 14B 2512](https://lisanbench.com/?tab=leaderboard&models=ministral-14b-2512) | Mistral AI | 12.29 |
| 143 | [Ministral 8B 2512](https://lisanbench.com/?tab=leaderboard&models=ministral-8b-2512) | Mistral AI | 11.78 |
| 144 | [Mistral Nemo](https://lisanbench.com/?tab=leaderboard&models=mistral-nemo) | Mistral AI | 11.47 |
| 145 | [GPT-5.4 nano](/models/gpt-5-4-nano) | OpenAI | 11.16 |
| 146 | [Gemma 3 4B](https://lisanbench.com/?tab=leaderboard&models=gemma-3-4b-it) | Google | 9.41 |
| 147 | [Qwen3 0.6B (16k)](https://lisanbench.com/?tab=leaderboard&models=Qwen3-0.6B-FP8%3Athinking-16k) | Alibaba | 9.24 |
| 148 | [Qwen3 4B](https://lisanbench.com/?tab=leaderboard&models=Qwen3-4B-FP8) | Alibaba | 7.90 |
| 149 | [Ministral 3B 2512](https://lisanbench.com/?tab=leaderboard&models=ministral-3b-2512) | Mistral AI | 6.64 |
| 150 | [Qwen3 1.7B](https://lisanbench.com/?tab=leaderboard&models=Qwen3-1.7B-FP8) | Alibaba | 6.27 |
| 151 | [Llama 3.1 8B](https://lisanbench.com/?tab=leaderboard&models=llama-3.1-8b-instruct) | Meta | 3.92 |
| 152 | [Llama 3.2 3B](https://lisanbench.com/?tab=leaderboard&models=llama-3.2-3b-instruct) | Meta | 2.85 |
| 153 | [Llama 3.2 1B](https://lisanbench.com/?tab=leaderboard&models=llama-3.2-1b-instruct) | Meta | 0.63 |
| 154 | [Qwen3 0.6B](https://lisanbench.com/?tab=leaderboard&models=Qwen3-0.6B-FP8) | Alibaba | 0.06 |

## FAQ

### What does LisanBench measure?

A word-chain reasoning benchmark that tests planning, recall, constraint following, and vocabulary depth by asking models to extend non-repeating edit-distance-1 chains.

### Which model leads the published LisanBench snapshot?

Claude Opus 4.7 (Adaptive) currently leads the published LisanBench snapshot with a score of 5122.60.

### How many models are evaluated on LisanBench?

The September 23, 2026 snapshot contains 154 AI models.

### Does LisanBench affect BenchLM's overall score?

Not directly. LisanBench is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.
