# CyberGym

> A cybersecurity task benchmark for evaluating defensive cyber workflows and vulnerability-oriented agent performance.

Canonical page: https://benchlm.ai/benchmarks/cybergym

- Category: [Agentic](/agentic)
- Last updated: September 4, 2026

## About CyberGym

- Year: 2026
- Tasks: 1,507 vulnerability analysis instances
- Format: Vulnerability reproduction and PoC generation
- Difficulty: Real-world cybersecurity
- Paper: [CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale](https://www.cybergym.io/)

CyberGym includes 1,507 benchmark instances from historical vulnerabilities across 188 large software projects. BenchLM stores CyberGym as a display-only agentic security benchmark when exact provider comparison values are published.

CyberGym is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (22 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Fugu Cyber](/models/sakana-fugu-cyber) | Sakana AI | 86.9% |
| 2 | [Gemini 3.8 Flash Cyber](/models/gemini-3-8-flash-cyber) | Google | 86.2% |
| 3 | [GPT-5.6 Sol](/models/gpt-5-6-sol) | OpenAI | 84.5% |
| 4 | [GLM-5.3](/models/glm-5-3) | Z.AI | 84.5% |
| 5 | [Claude Mythos 5](/models/claude-mythos-5) | Anthropic | 83.8% |
| 6 | [DeepSeek V4 Pro 0813](/models/deepseek-v4-pro-0813) | DeepSeek | 83.3% |
| 7 | [Gemini 3.5 Flash Cyber](/models/gemini-3-5-flash-cyber) | Google | 83.2% |
| 8 | [Claude Mythos Preview](/models/claude-mythos-preview) | Anthropic | 83.1% |
| 9 | [GPT-5.5](/models/gpt-5-5) | OpenAI | 81.8% |
| 10 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 81.8% |
| 11 | [GPT-5.4](/models/gpt-5-4) | OpenAI | 79.0% |
| 12 | [Hy4 preview](/models/hy4-preview) | Tencent | 78.4% |
| 13 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 77.9% |
| 14 | [DeepSeek V4 Flash 0731](/models/deepseek-v4-flash-0731) | DeepSeek | 76.7% |
| 15 | [Claude Opus 4.7 (Adaptive)](/models/claude-opus-4-7-adaptive) | Anthropic | 73.1% |
| 16 | [GLM-5.1](/models/glm-5-1) | Z.AI | 68.7% |
| 17 | [Claude Opus 4.6](/models/claude-opus-4-6) | Anthropic | 66.6% |
| 18 | [Claude Sonnet 4.6](/models/claude-sonnet-4-6) | Anthropic | 65.2% |
| 19 | [Muse Spark 1.1](/models/muse-spark-1-1) | Meta | 59.0% |
| 20 | [Claude Opus 4.5](/models/claude-opus-4-5) | Anthropic | 50.6% |
| 21 | [Muse Spark](/models/muse-spark) | Meta | 43.5% |
| 22 | [GLM-5](/models/glm-5) | Z.AI | 43.2% |

## FAQ

### What does CyberGym measure?

A cybersecurity task benchmark for evaluating defensive cyber workflows and vulnerability-oriented agent performance.

### Which model scores highest on CyberGym?

Fugu Cyber by Sakana AI currently leads with a score of 86.9% on CyberGym.

### How many models are evaluated on CyberGym?

22 AI models have been evaluated on CyberGym on BenchLM.

### Does CyberGym affect BenchLM's overall score?

Not directly. CyberGym is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Compare Top Models on CyberGym

- [Fugu Cyber vs Gemini 3.8 Flash Cyber](/compare/gemini-3-8-flash-cyber-vs-sakana-fugu-cyber)
- [Gemini 3.8 Flash Cyber vs GPT-5.6 Sol](/compare/gemini-3-8-flash-cyber-vs-gpt-5-6-sol)
- [GPT-5.6 Sol vs GLM-5.3](/compare/glm-5-3-vs-gpt-5-6-sol)
- [GLM-5.3 vs Claude Mythos 5](/compare/claude-mythos-5-vs-glm-5-3)
