# Scale Labs Visual-Language Understanding (Visual-Language Understanding)

> A Scale Labs public leaderboard mirrored as display-only reference data. It does not affect BenchLM rankings.

Canonical page: https://benchlm.ai/benchmarks/scale-visual-language-understanding

- Category: [Multimodal & Grounded](/multimodal-grounded)
- Last updated: September 29, 2026 snapshot

## About Visual-Language Understanding

- Year: 2026
- Tasks: 63 published rows
- Format: Published Scale leaderboard score
- Difficulty: External agent and model evaluation
- Paper: [Scale Labs leaderboard](https://labs.scale.com/leaderboard/visual_language_understanding)

BenchLM mirrors 63 published rows from the Visual-Language Understanding public table captured on September 29, 2026 snapshot.

Visual-Language Understanding is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (63 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Gemini 2.5 Pro Experimental (March 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 54.65% |
| 2 | [gemini-2.5-pro-preview-06-05](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 54.63% |
| 3 | [GPT-5.4 Pro](/models/gpt-5-4-pro) | OpenAI | 53.89% |
| 4 | [gpt-5-pro-2025-10-06](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 52.39% |
| 5 | [o4-mini (high) (April 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 51.79% |
| 6 | [o4-mini (medium) (April 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 51.66% |
| 7 | [o3 Pro (high) (June 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 51.63% |
| 8 | [gemini-3-pro-preview](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 51.49% |
| 9 | [gpt-5.4-2026-03-05 (xhigh thinking)](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 50.89% |
| 10 | [Gemini 2.5 Pro Preview (May 06 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 50.78% |
| 11 | [GPT-5 mini](/models/gpt-5-mini) | OpenAI | 50.39% |
| 12 | [o3 (high) (April 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 50.07% |
| 13 | [gpt-5-2025-08-07](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 49.69% |
| 14 | [o3 (medium) (April 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 49.59% |
| 15 | [Gemini 2.5 Flash Preview (May 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 49.15% |
| 16 | [Claude Sonnet 4.5 Thinking](/models/claude-sonnet-4-5-thinking) | Anthropic | 48.75% |
| 17 | [claude-opus-4-1-20250805-thinking](https://labs.scale.com/leaderboard/visual_language_understanding) | Anthropic | 48.44% |
| 18 | [Claude 3.7 Sonnet Thinking (Feb 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | Anthropic | 48.23% |
| 19 | [o1 Pro (March 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 47.32% |
| 20 | [Gemini 2.5 Flash (April 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 46.97% |
| 21 | [Claude Opus 4 (Thinking)](https://labs.scale.com/leaderboard/visual_language_understanding) | Anthropic | 46.96% |
| 22 | [gemini-3.1-flash-lite-preview](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 46.93% |
| 23 | [GPT-5.2](/models/gpt-5-2) | OpenAI | 46.62% |
| 24 | [Claude Opus 4.5 Thinking](/models/claude-opus-4-5-thinking) | Anthropic | 46.43% |
| 25 | [claude-opus-4-6-thinking-max](https://labs.scale.com/leaderboard/visual_language_understanding) | Anthropic | 46.07% |
| 26 | [Gemini 2.0 Flash Thinking Experimental](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 45.50% |
| 27 | [Claude Sonnet 4 (Thinking)](https://labs.scale.com/leaderboard/visual_language_understanding) | Anthropic | 45.49% |
| 28 | [claude-opus-4-6 (Non-Thinking)](https://labs.scale.com/leaderboard/visual_language_understanding) | Unknown | 45.48% |
| 29 | [GPT-4.1](/models/gpt-4-1) | OpenAI | 45.34% |
| 30 | [Claude Opus 4.5](/models/claude-opus-4-5) | Anthropic | 45.32% |
| 31 | [claude-opus-4-1-20250805](https://labs.scale.com/leaderboard/visual_language_understanding) | Anthropic | 45.25% |
| 32 | [o1 (December 2024)](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 45.25% |
| 33 | [Claude Sonnet 4.5](/models/claude-sonnet-4-5) | Anthropic | 45.00% |
| 34 | [gpt-5.1-thinking](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 43.82% |
| 35 | [Claude Opus 4](https://labs.scale.com/leaderboard/visual_language_understanding) | Anthropic | 43.53% |
| 36 | [Gemini 2.0 Pro Experimental (Feb 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 43.25% |
| 37 | [Claude Sonnet 4](https://labs.scale.com/leaderboard/visual_language_understanding) | Anthropic | 43.21% |
| 38 | [Claude 3.7 Sonnet (February 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | Anthropic | 43.02% |
| 39 | [GPT-4.5 Preview (February 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 42.11% |
| 40 | [Kimi K2.5](/models/kimi-k2-5) | Moonshot AI | 41.86% |
| 41 | [GPT-4.1 mini](/models/gpt-4-1-mini) | OpenAI | 41.14% |
| 42 | [Gemini 2.0 Flash Experimental](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 39.95% |
| 43 | [Gemini 2.0 Flash (February 2025)](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 39.85% |
| 44 | [Claude 3.5 Sonnet (October 2024)](https://labs.scale.com/leaderboard/visual_language_understanding) | Anthropic | 38.72% |
| 45 | [Claude 3.5 Sonnet (June 2024)](https://labs.scale.com/leaderboard/visual_language_understanding) | Anthropic | 38.37% |
| 46 | [Llama 4 Maverick](/models/llama-4-maverick) | Meta | 38.33% |
| 47 | [ChatGPT-4o-latest (November 2024)](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 37.99% |
| 48 | [Gemini 1.5 Pro](/models/gemini-1-5-pro) | Google | 37.07% |
| 49 | [GPT-4o (August 2024)](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 34.94% |
| 50 | [gpt-5.1-instant](https://labs.scale.com/leaderboard/visual_language_understanding) | OpenAI | 34.87% |
| 51 | [Mistral Medium 3](/models/mistral-medium-3) | Mistral | 34.59% |
| 52 | [Gemini 1.5 Flash 002](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 34.03% |
| 53 | [Pixtral Large (November 2024)](https://labs.scale.com/leaderboard/visual_language_understanding) | Mistral | 33.89% |
| 54 | [Gemini 2.0 Flash Lite Preview](https://labs.scale.com/leaderboard/visual_language_understanding) | Google | 32.69% |
| 55 | [Qwen2-VL-72B-Instruct](https://labs.scale.com/leaderboard/visual_language_understanding) | Alibaba | 28.56% |
| 56 | [Claude 3 Opus](/models/claude-3-opus) | Anthropic | 27.82% |
| 57 | [GPT-4.1 nano](/models/gpt-4-1-nano) | OpenAI | 26.55% |
| 58 | [Nova Pro](/models/nova-pro) | Amazon | 26.27% |
| 59 | [Pixtral 12B (September 2024)](https://labs.scale.com/leaderboard/visual_language_understanding) | Mistral | 25.97% |
| 60 | [Nova Lite](https://labs.scale.com/leaderboard/visual_language_understanding) | Amazon | 25.50% |
| 61 | [Llama 3.2 90B Vision Instruct](https://labs.scale.com/leaderboard/visual_language_understanding) | Meta | 24.61% |
| 62 | [Llama 3.2 11B Vision-Instruct](https://labs.scale.com/leaderboard/visual_language_understanding) | Meta | 20.47% |
| 63 | [Phi 3.5 Vision-Instruct](https://labs.scale.com/leaderboard/visual_language_understanding) | Microsoft | 15.18% |

## FAQ

### What does Visual-Language Understanding measure?

A Scale Labs public leaderboard mirrored as display-only reference data. It does not affect BenchLM rankings.

### Which model leads the published Visual-Language Understanding snapshot?

Gemini 2.5 Pro Experimental (March 2025) currently leads the published Visual-Language Understanding snapshot with a score of 54.65%.

### How many models are evaluated on Visual-Language Understanding?

The September 29, 2026 snapshot contains 63 AI models.

### Does Visual-Language Understanding affect BenchLM's overall score?

Not directly. Visual-Language Understanding is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.
