# Muse Spark 1.2 Benchmark Scores & Performance

> Muse Spark 1.2 by Meta scores 70.28/100 overall, ranking #14 out of 491 AI models.

Canonical page: https://benchlm.ai/models/muse-spark-1-2

Last updated: September 18, 2026

## Model Details

| Property | Value |
|----------|-------|
| Creator | Meta |
| Source Type | Proprietary |
| Reasoning Type | Reasoning |
| Context Window | 1M |
| Official model card | [Meta: Muse Spark 1.2 model page](https://developer.meta.com/ai/models/muse-spark/) |
| Overall Score | 70.28/100 |
| Overall Rank | #14 of 491 |

## Family & Coverage

- Family: Muse Spark
- Variant: 1.2 (1.2)
- Benchmarks covered: 23 of 446
- Sibling models: [Muse Spark 1.1](/models/muse-spark-1-1), [Muse Spark](/models/muse-spark), [Muse Spark 1.3](/models/muse-spark-1-3)
- Related earlier model: [Muse Spark 1.1](/models/muse-spark-1-1)
- Coverage note: BenchLM currently has partial benchmark coverage for this model, so the overall score is conservative.

## Agentic Benchmarks

| Benchmark | Score |
|-----------|-------|
| [Terminal-Bench 2.1](/benchmarks/terminalbench21) | 82.9% |
| [GDPval-AA](/benchmarks/gdpvalaa) | 1631 |
| [GDPval-AA](/benchmarks/gdpvalaanormalized) | 51.2% |
| [AA EnterpriseOps-Gym](/benchmarks/aaenterpriseopsgym) | 47.3% |
| [Terminal-Bench 2.1 (Vals)](/benchmarks/valsterminalbench21) | 69.7% |
| [AA Agentic Index](/benchmarks/aaagenticindex) | 44.0% |

## Coding Benchmarks

| Benchmark | Score |
|-----------|-------|
| [Terminal-Bench 2.1](/benchmarks/terminalbench21) | 82.9% |
| [DeepSWE](/benchmarks/deepswe) | 59.3% |
| [AA-SciCode](/benchmarks/aascicode) | 57.4% |
| [VulcanBench v3](/benchmarks/vulcanbench) | 87.0% |
| [FrontierSWE v2](/benchmarks/frontierswev2) | 12.0% |
| [SWE-bench (Vals)](/benchmarks/valsswebench) | 86.6% |
| [AA Coding Index](/benchmarks/aacodingindex) | 72.2% |

## Multimodal & Grounded Benchmarks

| Benchmark | Score |
|-----------|-------|
| [Design Arena Website](/benchmarks/designarenawebsite) | 1321 |

## Reasoning Benchmarks

| Benchmark | Score |
|-----------|-------|
| [AA-LCR](/benchmarks/lcr) | 79.0% |
| [CritPt](/benchmarks/critpt) | 17.7% |

## Knowledge Benchmarks

| Benchmark | Score |
|-----------|-------|
| [Artificial Analysis Intelligence Index](/benchmarks/artificialanalysis) | 39.8% |
| [AA-GPQA Diamond](/benchmarks/aagpqadiamond) | 90.4% |
| [AA-HLE](/benchmarks/aahle) | 45.5% |
| [AA-Omniscience Index](/benchmarks/aaomniscienceindex) | 27.2% |
| [AA-Omniscience Accuracy](/benchmarks/omniscienceaccuracy) | 45.4% |
| [AA-Omniscience Hallucination Rate](/benchmarks/omnisciencehallucinationrate) | 33.3% |
| [MMLU-Pro (Vals)](/benchmarks/valsmmlupro) | 88.3% |

## Other Meta Models

- [Muse Spark 1.1](/models/muse-spark-1-1) - Score: 70.18
- [Muse Spark](/models/muse-spark) - Score: 67.51
- [Muse Glimmer 30B](/models/muse-glimmer-30b) - Score: 45.08
- [Llama 4 Behemoth](/models/llama-4-behemoth) - Score: 38.22
- [Llama 3.1 405B](/models/llama-3-1-405b) - Score: 36.7
- [Llama 4 Scout](/models/llama-4-scout) - Score: 33.32
- [Llama 3 70B](/models/llama-3-70b) - Score: 30.73
- [Llama 4 Maverick](/models/llama-4-maverick) - Score: 22.73
- [Muse Spark 1.3](/models/muse-spark-1-3) - Score: not computed
- [Muse Voice Transcribe](/models/muse-voice-transcribe) - Score: not computed
