# HealthBench Professional

> An open benchmark for clinician-facing model responses across care consult, writing and documentation, and medical research tasks.

Canonical page: https://benchlm.ai/benchmarks/healthbenchprofessional

- Category: [Knowledge](/knowledge)
- Last updated: September 27, 2026

## About HealthBench Professional

- Year: 2026
- Tasks: Clinician chat tasks
- Format: Rubric-graded open-ended responses
- Difficulty: Professional clinical workflows
- Paper: [HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats](https://arxiv.org/abs/2604.27470)

HealthBench Professional uses physician-authored clinician conversations and physician-written rubrics to evaluate model responses on difficult clinical tasks. BenchLM tracks it as a display-only health benchmark because some source rows include product harnesses rather than raw base-model capability.

HealthBench Professional is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (11 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Claude Opus 5.5](/models/claude-opus-5-5) | Anthropic | 65.6% |
| 2 | [GPT-6 Astra](/models/gpt-6-astra) | OpenAI | 64.7% |
| 3 | [GPT-6 Sol](/models/gpt-6-sol) | OpenAI | 60.8% |
| 4 | [GPT-6 Luna](/models/gpt-6-luna) | OpenAI | 60.8% |
| 5 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 60.5% |
| 6 | [Claude Opus 5](/models/claude-opus-5) | Anthropic | 59.8% |
| 7 | [Muse Spark 1.1](/models/muse-spark-1-1) | Meta | 59.3% |
| 8 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 57.7% |
| 9 | [Grok 4.7](/models/grok-4-7) | xAI | 56.7% |
| 10 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 55.7% |
| 11 | [GPT-5.4](/models/gpt-5-4) | OpenAI | 48.1% |

## FAQ

### What does HealthBench Professional measure?

An open benchmark for clinician-facing model responses across care consult, writing and documentation, and medical research tasks.

### Which model scores highest on HealthBench Professional?

Claude Opus 5.5 by Anthropic currently leads with a score of 65.6% on HealthBench Professional.

### How many models are evaluated on HealthBench Professional?

11 AI models have been evaluated on HealthBench Professional on BenchLM.

### Does HealthBench Professional affect BenchLM's overall score?

Not directly. HealthBench Professional is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Compare Top Models on HealthBench Professional

- [Claude Opus 5.5 vs GPT-6 Astra](/compare/claude-opus-5-5-vs-gpt-6-astra)
- [GPT-6 Astra vs GPT-6 Sol](/compare/gpt-6-astra-vs-gpt-6-sol)
- [GPT-6 Sol vs GPT-6 Luna](/compare/gpt-6-luna-vs-gpt-6-sol)
- [GPT-6 Luna vs GPT-5.6 Sol](/compare/gpt-5-6-sol-vs-gpt-6-luna)
