# CharXiv Reasoning (CharXiv)

> A scientific chart reasoning benchmark that tests whether models can understand, interpret, and reason about complex scientific visualizations including plots, diagrams, and data charts.

Canonical page: https://benchlm.ai/benchmarks/charxiv

- Category: [Multimodal & Grounded](/multimodal-grounded)
- Last updated: October 7, 2026

## About CharXiv

- Year: 2024
- Tasks: Scientific chart reasoning
- Format: Chart understanding and reasoning
- Difficulty: Scientific visualization reasoning
- Paper: [CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs](https://charxiv.github.io/)

CharXiv evaluates a model's ability to reason about real-world scientific charts rather than simple visual QA. With-tools and without-tools variants isolate raw visual reasoning from tool-augmented performance.

The Multimodal & Grounded leaderboard ranks models by a weighted category score, and CharXiv contributes 20% of it. It does not enter the overall BenchAlign v5.8 ranking.

## Leaderboard (39 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Qwen3.8 Max](/models/qwen3-8-max) | Alibaba | 93.5% |
| 2 | [Claude Mythos 5](/models/claude-mythos-5) | Anthropic | 93.5% |
| 3 | [Qwen3.8-Omni-Flash](/models/qwen3-8-omni-flash) | Alibaba | 91.4% |
| 4 | [Kimi K3](/models/kimi-k3) | Moonshot AI | 91.3% |
| 5 | [Claude Opus 4.7 (Adaptive)](/models/claude-opus-4-7-adaptive) | Anthropic | 91% |
| 6 | [Qwen3.8-Flash-Next](/models/qwen3-8-flash-next) | Alibaba | 90.6% |
| 7 | [Qwen3.8-27B](/models/qwen3-8-27b) | Alibaba | 90.2% |
| 8 | [Claude Opus 4.8](/models/claude-opus-4-8) | Anthropic | 89.9% |
| 9 | [GLM-5.3-Flash](/models/glm-5-3-flash) | Z.AI | 89.4% |
| 10 | [Gemini 3.7 Flash](/models/gemini-3-7-flash) | Google | 88.7% |
| 11 | [Muse Spark 1.1](/models/muse-spark-1-1) | Meta | 88.4% |
| 12 | [Claude Sonnet 5](/models/claude-sonnet-5) | Anthropic | 88.3% |
| 13 | [Sakana Fugu-Ultra](/models/sakana-fugu-ultra) | Sakana AI | 86.6% |
| 14 | [Muse Spark](/models/muse-spark) | Meta | 86.4% |
| 15 | [Qwen3.7 Plus](/models/qwen3-7-plus) | Alibaba | 85.9% |
| 16 | [Seed 2.1 Pro](/models/seed-2-1-pro) | ByteDance | 85.4% |
| 17 | [Sakana Fugu](/models/sakana-fugu) | Sakana AI | 85.1% |
| 18 | [Gemini 3.5 Flash](/models/gemini-3-5-flash) | Google | 84.2% |
| 19 | [GPT-5.4](/models/gpt-5-4) | OpenAI | 82.8% |
| 20 | [Seed 2.1 Turbo](/models/seed-2-1-turbo) | ByteDance | 82.5% |
| 21 | [GPT-5.2](/models/gpt-5-2) | OpenAI | 82.1% |
| 22 | [Inkling](/models/inkling) | Thinking Machines Lab | 82% |
| 23 | [Qwen3.6 Plus](/models/qwen3-6-plus) | Alibaba | 81.5% |
| 24 | [Gemini 3 Pro](/models/gemini-3-pro) | Google | 81.4% |
| 25 | [Inkling-Small](/models/inkling-small) | Thinking Machines Lab | 81.3% |
| 26 | [MiMo-V2.5](/models/mimo-v2-5) | Xiaomi | 81% |
| 27 | [Qwen3.5 397B](/models/qwen3-5-397b) | Alibaba | 80.8% |
| 28 | [Kimi K2.6](/models/kimi-2-6) | Moonshot AI | 80.4% |
| 29 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | Google | 80.2% |
| 30 | [Muse Glimmer 30B](/models/muse-glimmer-30b) | Meta | 78.8% |
| 31 | [Qwen3.6-27B](/models/qwen3-6-27b) | Alibaba | 78.4% |
| 32 | [Qwen3.6-35B-A3B](/models/qwen3-6-35b-a3b) | Alibaba | 78% |
| 33 | [Claude Sonnet 4.6](/models/claude-sonnet-4-6) | Anthropic | 77.4% |
| 34 | [Qwen3.5-122B-A10B](/models/qwen3-5-122b-a10b) | Alibaba | 77.2% |
| 35 | [Nemotron 3 Nano Omni 30B A3B](/models/nemotron-3-nano-omni-30b-a3b) | NVIDIA | 76.3% |
| 36 | [Gemini 3.1 Flash-Lite](/models/gemini-3-1-flash-lite) | Google | 73.2% |
| 37 | [Claude Opus 4.5](/models/claude-opus-4-5) | Anthropic | 68.5% |
| 38 | [Grok 4.20](/models/grok-4-20-beta) | xAI | 60.9% |
| 39 | [Command A+](/models/command-a-plus) | Cohere | 52.7% |

## FAQ

### What does CharXiv measure?

A scientific chart reasoning benchmark that tests whether models can understand, interpret, and reason about complex scientific visualizations including plots, diagrams, and data charts.

### Which model scores highest on CharXiv?

Qwen3.8 Max by Alibaba currently leads with a score of 93.5% on CharXiv.

### How many models are evaluated on CharXiv?

39 AI models have published results on CharXiv in the BenchLM catalog.

### Does CharXiv affect BenchLM's overall score?

Not the overall score. The Multimodal & Grounded leaderboard ranks models by a weighted category score, and CharXiv contributes 20% of it. It does not enter the overall BenchAlign v5.8 ranking.

## Compare Top Models on CharXiv

- [Qwen3.8 Max vs Claude Mythos 5](/compare/claude-mythos-5-vs-qwen3-8-max)
- [Claude Mythos 5 vs Qwen3.8-Omni-Flash](/compare/claude-mythos-5-vs-qwen3-8-omni-flash)
- [Qwen3.8-Omni-Flash vs Kimi K3](/compare/kimi-k3-vs-qwen3-8-omni-flash)
- [Kimi K3 vs Claude Opus 4.7 (Adaptive)](/compare/claude-opus-4-7-adaptive-vs-kimi-k3)
