# Inkling-Small Benchmark Scores & Performance

> Inkling-Small by Thinking Machines Lab scores 59.25/100 overall, ranking #63 out of 483 AI models.

Canonical page: https://benchlm.ai/models/inkling-small

Last updated: September 10, 2026

## Model Details

| Property | Value |
|----------|-------|
| Creator | Thinking Machines Lab |
| Source Type | Open Weight |
| Reasoning Type | Hybrid |
| Context Window | 1M |
| Overall Score | 59.25/100 |
| Overall Rank | #63 of 483 |

## Family & Coverage

- Family: Inkling
- Variant: small (Small)
- Benchmarks covered: 38 of 435
- Sibling models: [Inkling](/models/inkling)
- Coverage note: BenchLM currently has partial benchmark coverage for this model, so the overall score is conservative.

## Agentic Benchmarks

| Benchmark | Score |
|-----------|-------|
| [Terminal-Bench 2.0](/benchmarks/terminal-bench-2) | 64.7% |
| [BrowseComp](/benchmarks/browsecomp) | 77.4% |
| [MCP Atlas](/benchmarks/mcpatlas) | 79.6% |
| [Toolathlon-Verified](/benchmarks/toolathlonverified) | 54.4% |
| [GDPval-AA](/benchmarks/gdpvalaanormalized) | 34.6% |
| [Terminal-Bench 2.1 (Vals)](/benchmarks/valsterminalbench21) | 55.1% |
| [AA Agentic Index](/benchmarks/aaagenticindex) | 24.9% |
| [GDPval-AA](/benchmarks/gdpvalaa) | 1191 |

## Coding Benchmarks

| Benchmark | Score |
|-----------|-------|
| [SWE-bench Verified](/benchmarks/swe-bench-verified) | 80.2% |
| [SWE-bench Pro](/benchmarks/swe-bench-pro) | 55.9% |
| [Terminal-Bench 2.0](/benchmarks/terminal-bench-2) | 64.7% |
| [SciCode](/benchmarks/scicode) | 48.7% |
| [AA-SciCode](/benchmarks/aascicode) | 49.7% |
| [LiveCodeBench (Vals)](/benchmarks/valslivecodebench) | 85.9% |
| [SWE-bench (Vals)](/benchmarks/valsswebench) | 82.2% |
| [AA Coding Index](/benchmarks/aacodingindex) | 53.0% |

## Multimodal & Grounded Benchmarks

| Benchmark | Score |
|-----------|-------|
| [MMMU-Pro](/benchmarks/mmmu-pro) | 74% |
| [CharXiv](/benchmarks/charxiv) | 81.3% |
| [CharXiv w/o tools](/benchmarks/charxivnotools) | 77.4% |
| [AA-MMMU-Pro](/benchmarks/aammmupro) | 74.0% |

## Reasoning Benchmarks

| Benchmark | Score |
|-----------|-------|
| [ARC-AGI-2](/benchmarks/arc-agi-2) | 40.1% |
| [CritPt](/benchmarks/critpt) | 8.3% |
| [AA-LCR](/benchmarks/lcr) | 75.7% |

## Knowledge Benchmarks

| Benchmark | Score |
|-----------|-------|
| [GPQA](/benchmarks/gpqa) | 89.5% |
| [GPQA-D](/benchmarks/gpqa-diamond) | 89.5% |
| [HLE](/benchmarks/hle) | 47.8% |
| [HLE w/o tools](/benchmarks/hlenotools) | 31.6% |
| [Artificial Analysis Intelligence Index](/benchmarks/artificialanalysis) | 26.1% |
| [AA-GPQA Diamond](/benchmarks/aagpqadiamond) | 89.5% |
| [AA-HLE](/benchmarks/aahle) | 33.3% |
| [AA-Omniscience Index](/benchmarks/aaomniscienceindex) | -8.9% |
| [AA-Omniscience Accuracy](/benchmarks/omniscienceaccuracy) | 33.2% |
| [AA-Omniscience Hallucination Rate](/benchmarks/omnisciencehallucinationrate) | 63.0% |
| [GPQA Diamond (Vals)](/benchmarks/valsgpqadiamond) | 83.6% |
| [MMLU-Pro (Vals)](/benchmarks/valsmmlupro) | 85.6% |

## Instruction Following Benchmarks

| Benchmark | Score |
|-----------|-------|
| [IFBench](/benchmarks/ifbench) | 82.2% |

## Mathematics Benchmarks

| Benchmark | Score |
|-----------|-------|
| [AIME26](/benchmarks/aime2026) | 95.5% |
| [HMMT Feb 2026](/benchmarks/hmmtfeb2026) | 90.2% |

## Other Thinking Machines Lab Models

- [Inkling](/models/inkling) - Score: 60.28
