# APEX-Agents-AA

> Artificial Analysis' implementation of the APEX-Agents benchmark for long-horizon professional-services agent tasks.

Canonical page: https://benchlm.ai/benchmarks/apexagentsaa

- Category: [Agentic](/agentic)
- Last updated: September 27, 2026

## About APEX-Agents-AA

- Year: 2026
- Tasks: 452 professional-services agent tasks
- Format: Pass@1
- Difficulty: Long-horizon workplace agent tasks
- Paper: [APEX-Agents-AA Benchmark Leaderboard](https://artificialanalysis.ai/evaluations/apex-agents-aa)

BenchLM stores APEX-Agents-AA as a display-only agentic row. Artificial Analysis reports pass@1 over 452 public APEX-Agents tasks spanning investment banking, management consulting, and corporate law.

APEX-Agents-AA is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (26 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Gemini 3.5 Flash](/models/gemini-3-5-flash) | Google | 47.1% |
| 2 | [Kimi K3](/models/kimi-k3) | Moonshot AI | 41.3% |
| 3 | [GPT-5.6 Terra](/models/gpt-5-6-terra) | OpenAI | 38.9% |
| 4 | [GPT-5.5](/models/gpt-5-5) | OpenAI | 37.7% |
| 5 | [GPT-5.6 Luna](/models/gpt-5-6-luna) | OpenAI | 35.8% |
| 6 | [GLM-5.2](/models/glm-5-2) | Z.AI | 33.7% |
| 7 | [GPT-5.4](/models/gpt-5-4) | OpenAI | 33.3% |
| 8 | [Claude Opus 4.6 (Adaptive)](/models/claude-opus-4-6-thinking) | Anthropic | 33.0% |
| 9 | [Gemini 3.1 Pro](/models/gemini-3-1-pro) | Google | 32.0% |
| 10 | [Apodex 1.1](/models/apodex-1-1) | Apodex | 31.2% |
| 11 | [Apodex 1.1 Mini](/models/apodex-1-1-mini) | Apodex | 31.2% |
| 12 | [Kimi K2.6](/models/kimi-2-6) | Moonshot AI | 28.5% |
| 13 | [GPT-5.4 mini](/models/gpt-5-4-mini) | OpenAI | 28.2% |
| 14 | [GPT-5.4 nano](/models/gpt-5-4-nano) | OpenAI | 24.9% |
| 15 | [DeepSeek V4 Pro 0813](/models/deepseek-v4-pro-0813) | DeepSeek | 24.3% |
| 16 | [Qwen3.7 Plus](/models/qwen3-7-plus) | Alibaba | 22.4% |
| 17 | [Grok 4.3](/models/grok-4-3) | xAI | 17.0% |
| 18 | [Step 3.7 Flash](/models/step-3-7-flash) | StepFun | 14.8% |
| 19 | [GLM-5](/models/glm-5) | Z.AI | 14.5% |
| 20 | [Kimi K2.5](/models/kimi-k2-5) | Moonshot AI | 11.5% |
| 21 | [Kimi K2.5 (Reasoning)](/models/kimi-k2-5-reasoning) | Moonshot AI | 11.5% |
| 22 | [MiniMax M2.7](/models/minimax-m2-7) | MiniMax | 10.6% |
| 23 | [GPT-OSS 120B](/models/gpt-oss-120b) | OpenAI | 3.1% |
| 24 | [MiMo-V2.5-Pro](/models/mimo-v2-5-pro) | Xiaomi | 2.4% |
| 25 | [Nemotron 3 Super 100B](/models/nemotron-3-super-100b) | NVIDIA | 1.8% |
| 26 | [GPT-OSS 20B](/models/gpt-oss-20b) | OpenAI | 0.7% |

## FAQ

### What does APEX-Agents-AA measure?

Artificial Analysis' implementation of the APEX-Agents benchmark for long-horizon professional-services agent tasks.

### Which model scores highest on APEX-Agents-AA?

Gemini 3.5 Flash by Google currently leads with a score of 47.1% on APEX-Agents-AA.

### How many models are evaluated on APEX-Agents-AA?

26 AI models have been evaluated on APEX-Agents-AA on BenchLM.

### Does APEX-Agents-AA affect BenchLM's overall score?

Not directly. APEX-Agents-AA is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Compare Top Models on APEX-Agents-AA

- [Gemini 3.5 Flash vs Kimi K3](/compare/gemini-3-5-flash-vs-kimi-k3)
- [Kimi K3 vs GPT-5.6 Terra](/compare/gpt-5-6-terra-vs-kimi-k3)
- [GPT-5.6 Terra vs GPT-5.5](/compare/gpt-5-5-vs-gpt-5-6-terra)
- [GPT-5.5 vs GPT-5.6 Luna](/compare/gpt-5-5-vs-gpt-5-6-luna)
