# Best Factuality AI Models in 2026

> AI models ranked on sourced factuality and hallucination-adjacent benchmarks including SimpleQA, HLE without tools, and Facts-VLM.

This reporting page is intentionally narrow. It focuses on currently tracked sourced factuality signals such as SimpleQA, HLE without tools, and multimodal factuality. It is a reporting page, not a mature weighted category.

Canonical page: https://benchlm.ai/best/factuality

Last updated: October 5, 2026

## Rankings

| Rank | Model | Creator | Type | Context | Score |
|------|-------|---------|------|---------|-------|
| 1 | [Claude Opus 5.5](/models/claude-opus-5-5) | Anthropic | Proprietary | 1M | 64.4 |
| 2 | [Claude Fable 5.1](/models/claude-fable-5-1) | Anthropic | Proprietary | 1M | 60.9 |
| 3 | [Claude Mythos 5](/models/claude-mythos-5) | Anthropic | Proprietary | 1M+ | 59 |
| 4 | [DeepSeek V4 Pro 0813](/models/deepseek-v4-pro-0813) | DeepSeek | Open Weight | 1M | 57.9 |
| 5 | [Claude Sonnet 5.5](/models/claude-sonnet-5-5) | Anthropic | Proprietary | 1M | 56.9 |
| 6 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | Proprietary | null | 56.3 |
| 7 | [Muse Spark 1.1](/models/muse-spark-1-1) | Meta | Proprietary | 1M | 52.2 |
| 8 | [Sakana Fugu-Ultra](/models/sakana-fugu-ultra) | Sakana AI | Proprietary | 1M | 50 |
| 9 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | Proprietary | 1M | 49.8 |
| 10 | [Pareto 26.9](/models/pareto-26-9) | Unbiased | Proprietary | N/A | 49 |
| 11 | [Sakana Fugu](/models/sakana-fugu) | Sakana AI | Proprietary | 1M | 47.2 |
| 12 | [Claude Opus 4.7 (Adaptive)](/models/claude-opus-4-7-adaptive) | Anthropic | Proprietary | 1M | 46.9 |
| 13 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | Google | Proprietary | 1M | 45.4 |
| 14 | [Ornith-1.5-397B](/models/ornith-1-5-397b) | Ornith AI | Open Weight | 262K | 44.6 |
| 15 | [Qwen3.8 Max](/models/qwen3-8-max) | Alibaba | Open Weight | 1M | 43.6 |
| 16 | [Kimi K3](/models/kimi-k3) | Moonshot AI | Pending | 1.05M | 43.5 |
| 17 | [Hy4 preview](/models/hy4-preview) | Tencent | Open Weight | 1M | 43.4 |
| 18 | [Claude Sonnet 5](/models/claude-sonnet-5) | Anthropic | Proprietary | 1M | 43.2 |
| 19 | [GPT-5.5 Pro](/models/gpt-5-5-pro) | OpenAI | Proprietary | 1M | 43.1 |
| 20 | [Muse Spark](/models/muse-spark) | Meta | Proprietary | 262K | 42.8 |
| 21 | [GPT-5.4 Pro](/models/gpt-5-4-pro) | OpenAI | Proprietary | 1.05M | 42.7 |
| 22 | [GPT-5.5](/models/gpt-5-5) | OpenAI | Proprietary | 1M | 41.4 |
| 23 | [GLM-5.2](/models/glm-5-2) | Z.AI | Open Weight | 1M | 40.5 |
| 24 | [Claude Opus 4.6](/models/claude-opus-4-6) | Anthropic | Proprietary | 1M | 40 |
| 25 | [GPT-5.4](/models/gpt-5-4) | OpenAI | Proprietary | 1.05M | 39.8 |
| 26 | [Beam](/models/reflection-beam) | Reflection AI | Pending | null | 36.2 |
| 27 | [Qwen3.8-Flash-Next](/models/qwen3-8-flash-next) | Alibaba | Open Weight | 262K | 35.9 |
| 28 | [DeepSeek V4 Flash 0731](/models/deepseek-v4-flash-0731) | DeepSeek | Open Weight | 1M | 34.1 |
| 29 | [MiMo-V2.5-Pro](/models/mimo-v2-5-pro) | Xiaomi | Proprietary | 1M | 34 |
| 30 | [Grok 4.20](/models/grok-4-20-beta) | xAI | Proprietary | 2M | 31.6 |
| 31 | [Inkling-Small](/models/inkling-small) | Thinking Machines Lab | Open Weight | 1M | 31.6 |
| 32 | [MAI-Thinking-1](/models/mai-thinking-1) | Microsoft | Proprietary | 256K | 31 |
| 33 | [Qwen3.8-27B](/models/qwen3-8-27b) | Alibaba | Open Weight | 262K | 30.8 |
| 34 | [Inkling](/models/inkling) | Thinking Machines Lab | Open Weight | 1M | 30 |
| 35 | [Solar Open 2](/models/solar-open-2) | Upstage | Open Weight | 1M | 28.8 |
| 36 | [GPT-5.4 mini](/models/gpt-5-4-mini) | OpenAI | Proprietary | 400K | 28.2 |
| 37 | [Nemotron 3 Ultra](/models/nemotron-3-ultra) | NVIDIA | Open Weight | 1M | 26.7 |
| 38 | [Ornith-1.5-35B-A3B](/models/ornith-1-5-35b-a3b) | Ornith AI | Open Weight | 262K | 25.6 |
| 39 | [GPT-5.4 nano](/models/gpt-5-4-nano) | OpenAI | Proprietary | 400K | 24.3 |
| 40 | [Ornith-1.5-9B](/models/ornith-1-5-9b) | Ornith AI | Open Weight | 262K | 20.2 |
| 41 | [Gemma 4 31B](/models/gemma-4-31b) | Google | Open Weight | 256K | 19.5 |
| 42 | [Nemotron 3.5 Lightning 30B A3B NVFP4](/models/nemotron-3-5-lightning-30b-a3b-nvfp4) | NVIDIA | Open Weight | 1M | 10.5 |
| 43 | [Gemma 4 26B A4B](/models/gemma-4-26b-a4b) | Google | Open Weight | 256K | 8.7 |
| 44 | [Gemma 4 12B](/models/gemma-4-12b) | Google | Open Weight | 256K | 5.2 |

## Key Takeaways

- Top model: [Claude Opus 5.5](/models/claude-opus-5-5) with a score of 64.4
- Best open-weight option: [DeepSeek V4 Pro 0813](/models/deepseek-v4-pro-0813) at #4
- Models included: 44

## Compare the Leaders

- [Claude Opus 5.5 vs Claude Fable 5.1](/compare/claude-fable-5-1-vs-claude-opus-5-5)
