# AI cybersecurity benchmarks

Compare GPT-5.6 Sol, GPT-5.6 Cyber, Claude Mythos 5, and other models across source-backed cybersecurity evaluations. The protocols stay separate because exploit, cyber-range, vulnerability-reproduction, and access-compliance results are not interchangeable.

## No blended cyber score

CyberGym, CWE-Bench, ExploitGym, ExploitBench, SEC-Bench Pro, FrontierCyber, CyScenarioBench, SCONE, and Advanced Cyber Completion Rate measure different things under different harnesses. BenchLM keeps every cyber row display only.

## Daybreak Blue and Red

Daybreak Blue is an access configuration for GPT-5.6 Sol. Daybreak Red provides trusted access to the separate GPT-5.6 Cyber model. Advanced Cyber Completion Rate measures approved-request completion rather than general cyber capability.

## Model evidence

- [Gemini 3.8 Flash Cyber](/models/gemini-3-8-flash-cyber)

- [GPT-5.6 Sol](/models/gpt-5-6-sol)

- [GPT-5.6 Cyber](/models/gpt-5-6-cyber)

- [Claude Mythos 5](/models/claude-mythos-5)

- [Claude Mythos Preview](/models/claude-mythos-preview)

Last updated: September 18, 2026

Canonical page: https://benchlm.ai/cybersecurity
