# GLM-5.1 Benchmark Scores & Performance

> GLM-5.1 by Z.AI scores 57.71/100 overall, ranking #48 out of 507 AI models.

Canonical page: https://benchlm.ai/models/glm-5-1

Last updated: September 23, 2026

## Model Details

| Property | Value |
|----------|-------|
| Creator | Z.AI |
| Source Type | Open Weight |
| Reasoning Type | Reasoning |
| Context Window | 203K |
| Overall Score | 57.71/100 |
| Overall Rank | #48 of 507 |

## Family & Coverage

- Family: GLM-5
- Variant: snapshot (5.1)
- Benchmarks covered: 42 of 483
- Sibling models: [GLM-5.3](/models/glm-5-3), [GLM-5.2](/models/glm-5-2), [GLM-5.3-Flash](/models/glm-5-3-flash), [GLM-5](/models/glm-5), [GLM-5-Turbo](/models/glm-5-turbo), [GLM-5V-Turbo](/models/glm-5v-turbo), [GLM-5 (Reasoning)](/models/glm-5-reasoning)
- Related earlier model: [GLM-5](/models/glm-5)
- Coverage note: BenchLM currently has partial benchmark coverage for this model, so the overall score is conservative.

## Agentic Benchmarks

| Benchmark | Score |
|-----------|-------|
| [Terminal-Bench 2.0](/benchmarks/terminal-bench-2) | 63.5% |
| [BrowseComp](/benchmarks/browsecomp) | 68% |
| [τ³-bench results](/benchmarks/tau3-bench) | 70.6% |
| [MCP Atlas](/benchmarks/mcpatlas) | 71.8% |
| [CyberGym](/benchmarks/cybergym) | 68.7% |
| [Claw-Eval](/benchmarks/claw-eval) | 62.3% |
| [τ²-bench results](/benchmarks/tau2-bench) | 97.7% |
| [GDPval-AA](/benchmarks/gdpvalaanormalized) | 30.2% |
| [Gert Labs](/benchmarks/gertlabs) | 60.11% |
| [ResearchClawBench](/benchmarks/researchclawbench) | 18.2% |
| [Terminal-Bench 2.1 (Vals)](/benchmarks/valsterminalbench21) | 56.9% |
| [AA Agentic Index](/benchmarks/aaagenticindex) | 25.2% |
| [GDPval-AA](/benchmarks/gdpvalaa) | 1181 |

## Coding Benchmarks

| Benchmark | Score |
|-----------|-------|
| [SWE-bench Pro](/benchmarks/swe-bench-pro) | 58.4% |
| [NL2Repo](/benchmarks/nl2repo) | 42.7% |
| [SWE-Rebench](/benchmarks/swe-rebench) | 62.7% |
| [Vibe Code Bench](/benchmarks/vibecodebench) | 31.46% |
| [AA-SciCode](/benchmarks/aascicode) | 44.8% |
| [OpenHarmony Bench](/benchmarks/openharmonybench) | 52.3% |
| [LiveCodeBench (Vals)](/benchmarks/valslivecodebench) | 81.4% |
| [SWE-bench (Vals)](/benchmarks/valsswebench) | 76.4% |
| [AA Coding Index](/benchmarks/aacodingindex) | 55.8% |

## Multimodal & Grounded Benchmarks

| Benchmark | Score |
|-----------|-------|
| [Design Arena Website](/benchmarks/designarenawebsite) | 1290 |

## Reasoning Benchmarks

| Benchmark | Score |
|-----------|-------|
| [AA-LCR](/benchmarks/lcr) | 73.7% |
| [CritPt](/benchmarks/critpt) | 4.6% |

## Knowledge Benchmarks

| Benchmark | Score |
|-----------|-------|
| [GPQA-D](/benchmarks/gpqa-diamond) | 86.2% |
| [HLE](/benchmarks/hle) | 52.3% |
| [Artificial Analysis Intelligence Index](/benchmarks/artificialanalysis) | 26.1% |
| [AA-GPQA Diamond](/benchmarks/aagpqadiamond) | 86.8% |
| [AA-HLE](/benchmarks/aahle) | 30.1% |
| [AA-Omniscience Index](/benchmarks/aaomniscienceindex) | 0.9% |
| [AA-Omniscience Accuracy](/benchmarks/omniscienceaccuracy) | 23.7% |
| [AA-Omniscience Hallucination Rate](/benchmarks/omnisciencehallucinationrate) | 29.9% |
| [GPQA Diamond (Vals)](/benchmarks/valsgpqadiamond) | 84.5% |
| [MMLU-Pro (Vals)](/benchmarks/valsmmlupro) | 86.9% |

## Instruction Following Benchmarks

| Benchmark | Score |
|-----------|-------|
| [AA-IFBench](/benchmarks/aaifbench) | 76.3% |

## Mathematics Benchmarks

| Benchmark | Score |
|-----------|-------|
| [AIME26](/benchmarks/aime2026) | 95.3% |
| [HMMT Nov 2025](/benchmarks/hmmtnov2025) | 94.0% |
| [HMMT Feb 2026](/benchmarks/hmmtfeb2026) | 82.6% |
| [MMAnswerBench](/benchmarks/mmanswerbench) | 83.8% |
| [FrontierMath v2 (Tiers 1-3)](/benchmarks/frontiermathv2tiers13) | 33.448% |
| [FrontierMath v2 (Tier 4)](/benchmarks/frontiermathv2tier4) | 12.500% |

## Other Z.AI Models

- [GLM-5.3](/models/glm-5-3) - Score: 65.55
- [GLM-5.2](/models/glm-5-2) - Score: 62.5
- [GLM-5.3-Flash](/models/glm-5-3-flash) - Score: 58.17
- [GLM-5](/models/glm-5) - Score: 55.36
- [GLM-5-Turbo](/models/glm-5-turbo) - Score: 52.77
- [GLM-4.7](/models/glm-4-7) - Score: 50.17
- [GLM-5V-Turbo](/models/glm-5v-turbo) - Score: 48.9
- [GLM-4.6](/models/glm-4-6) - Score: 39.78
- [GLM-4.7-Flash](/models/glm-4-7-flash) - Score: 38.14
- [GLM-4.5-Air](/models/glm-4-5-air) - Score: 34.63
- [GLM-4.5](/models/glm-4-5) - Score: not computed
- [GLM-5 (Reasoning)](/models/glm-5-reasoning) - Score: not computed
