# Humanity's Last Exam without tools (HLE w/o tools)

> Tool-free variant of Humanity's Last Exam that isolates a model's raw frontier reasoning.

Canonical page: https://benchlm.ai/benchmarks/hlenotools

- Category: [Knowledge](/knowledge)
- Last updated: September 18, 2026

## About HLE w/o tools

- Year: 2026
- Tasks: Expert-level questions
- Format: Tool-free expert QA
- Difficulty: Frontier expert level
- Paper: [Introducing GPT-5.4 mini and nano](https://openai.com/index/introducing-gpt-5-4-mini-and-nano/)

This variant removes external tools so the score reflects pure model performance on frontier expert questions.

HLE w/o tools is currently weighted in BenchLM's scoring formula. The Knowledge category carries 12% of the overall score, and HLE w/o tools contributes 10% of that category score.

## Leaderboard (38 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Claude Fable 5.1](/models/claude-fable-5-1) | Anthropic | 60.9% |
| 2 | [Claude Mythos 5](/models/claude-mythos-5) | Anthropic | 59% |
| 3 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 56.3% |
| 4 | [Muse Spark 1.1](/models/muse-spark-1-1) | Meta | 52.2% |
| 5 | [Sakana Fugu-Ultra](/models/sakana-fugu-ultra) | Sakana AI | 50% |
| 6 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 49.8% |
| 7 | [Pareto 26.9](/models/pareto-26-9) | Unbiased | 49% |
| 8 | [Sakana Fugu](/models/sakana-fugu) | Sakana AI | 47.2% |
| 9 | [Claude Opus 4.7 (Adaptive)](/models/claude-opus-4-7-adaptive) | Anthropic | 46.9% |
| 10 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | Google | 45.4% |
| 11 | [Ornith-1.5-397B](/models/ornith-1-5-397b) | Ornith AI | 44.6% |
| 12 | [Qwen3.8 Max](/models/qwen3-8-max) | Alibaba | 43.6% |
| 13 | [Kimi K3](/models/kimi-k3) | Moonshot AI | 43.5% |
| 14 | [Hy4 preview](/models/hy4-preview) | Tencent | 43.4% |
| 15 | [Claude Sonnet 5](/models/claude-sonnet-5) | Anthropic | 43.2% |
| 16 | [GPT-5.5 Pro](/models/gpt-5-5-pro) | OpenAI | 43.1% |
| 17 | [Muse Spark](/models/muse-spark) | Meta | 42.8% |
| 18 | [GPT-5.4 Pro](/models/gpt-5-4-pro) | OpenAI | 42.7% |
| 19 | [GPT-5.5](/models/gpt-5-5) | OpenAI | 41.4% |
| 20 | [GLM-5.2](/models/glm-5-2) | Z.AI | 40.5% |
| 21 | [Claude Opus 4.6](/models/claude-opus-4-6) | Anthropic | 40% |
| 22 | [GPT-5.4](/models/gpt-5-4) | OpenAI | 39.8% |
| 23 | [Qwen3.8-Flash-Next](/models/qwen3-8-flash-next) | Alibaba | 35.9% |
| 24 | [MiMo-V2.5-Pro](/models/mimo-v2-5-pro) | Xiaomi | 34% |
| 25 | [Grok 4.20](/models/grok-4-20-beta) | xAI | 31.6% |
| 26 | [Inkling-Small](/models/inkling-small) | Thinking Machines Lab | 31.6% |
| 27 | [Qwen3.8-27B](/models/qwen3-8-27b) | Alibaba | 30.8% |
| 28 | [Inkling](/models/inkling) | Thinking Machines Lab | 30% |
| 29 | [Solar Open 2](/models/solar-open-2) | Upstage | 28.8% |
| 30 | [GPT-5.4 mini](/models/gpt-5-4-mini) | OpenAI | 28.2% |
| 31 | [Nemotron 3 Ultra](/models/nemotron-3-ultra) | NVIDIA | 26.7% |
| 32 | [Ornith-1.5-35B-A3B](/models/ornith-1-5-35b-a3b) | Ornith AI | 25.6% |
| 33 | [GPT-5.4 nano](/models/gpt-5-4-nano) | OpenAI | 24.3% |
| 34 | [Ornith-1.5-9B](/models/ornith-1-5-9b) | Ornith AI | 20.2% |
| 35 | [Gemma 4 31B](/models/gemma-4-31b) | Google | 19.5% |
| 36 | [Nemotron 3.5 Lightning 30B A3B NVFP4](/models/nemotron-3-5-lightning-30b-a3b-nvfp4) | NVIDIA | 10.5% |
| 37 | [Gemma 4 26B A4B](/models/gemma-4-26b-a4b) | Google | 8.7% |
| 38 | [Gemma 4 12B](/models/gemma-4-12b) | Google | 5.2% |

## FAQ

### What does HLE w/o tools measure?

Tool-free variant of Humanity's Last Exam that isolates a model's raw frontier reasoning.

### Which model scores highest on HLE w/o tools?

Claude Fable 5.1 by Anthropic currently leads with a score of 60.9% on HLE w/o tools.

### How many models are evaluated on HLE w/o tools?

38 AI models have been evaluated on HLE w/o tools on BenchLM.

### Does HLE w/o tools affect BenchLM's overall score?

Yes. HLE w/o tools is a weighted benchmark inside the Knowledge category, which carries 12% of BenchLM's overall score. HLE w/o tools itself contributes 10% of that category score.

## Compare Top Models on HLE w/o tools

- [Claude Fable 5.1 vs Claude Mythos 5](/compare/claude-fable-5-1-vs-claude-mythos-5)
- [Claude Mythos 5 vs Claude Opus 5](/compare/claude-mythos-5-vs-claude-opus-5)
- [Claude Opus 5 vs Muse Spark 1.1](/compare/claude-opus-5-vs-muse-spark-1-1)
- [Muse Spark 1.1 vs Sakana Fugu-Ultra](/compare/muse-spark-1-1-vs-sakana-fugu-ultra)
