# Muse Spark Benchmark Scores & Performance

> Muse Spark by Meta scores 59.99/100 overall, ranking #49 out of 784 AI models.

Canonical page: https://benchlm.ai/models/muse-spark

Last updated: October 5, 2026

## Model Details

| Property | Value |
|----------|-------|
| Creator | Meta |
| Source Type | Proprietary |
| Reasoning Type | Reasoning |
| Context Window | 262K |
| Overall Score | 59.99/100 |
| Overall Rank | #49 of 784 |

## Family & Coverage

- Family: Muse Spark
- Variant: base
- Benchmarks covered: 40 of 649
- Sibling models: [Muse Spark 1.2](/models/muse-spark-1-2), [Muse Spark 1.1](/models/muse-spark-1-1), [Muse Spark 1.3](/models/muse-spark-1-3)
- Coverage note: BenchLM currently has partial benchmark coverage for this model, so the overall score is conservative.

## Agentic Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [Terminal-Bench 2.0](/benchmarks/terminal-bench-2) | 59% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [τ²-bench results](/benchmarks/tau2-bench) | 91.5% | [Meta AI: Muse Spark eval methodology](https://ai.meta.com/static-resource/muse-spark-eval-methodology) |
| [DeepSearchQA](/benchmarks/deepsearchqa) | 74.8% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [CyberGym](/benchmarks/cybergym) | 43.5% | [CyberGym leaderboard](https://cybergym.io/) |
| [Claw-Eval](/benchmarks/claw-eval) | 63.8% | [Claw-Eval leaderboard](https://claw-eval.github.io/) |
| [GDPval-AA](/benchmarks/gdpvalaanormalized) | 24.3% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |
| [GDPval-AA](/benchmarks/gdpvalaa) | 1076 | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |

## Coding Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [SWE-bench Verified](/benchmarks/swe-bench-verified) | 77.4% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [SWE-bench Pro](/benchmarks/swe-bench-pro) | 52.4% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [LiveCodeBench Pro](/benchmarks/livecodebench-pro) | 80.0% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [Vibe Code Bench](/benchmarks/vibecodebench) | 19.67% | [Vals AI: Vibe Code Bench v1.1](https://www.vals.ai/benchmarks/vibe-code) |
| [AA Coding Index](/benchmarks/aacodingindex) | 58.6% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |
| [SWE-bench (Vals)](/benchmarks/valsswebench) | 74.4% | [Vals AI: SWE-bench leaderboard](https://www.vals.ai/models/meta_muse_spark) |

## Multimodal & Grounded Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [CharXiv](/benchmarks/charxiv) | 86.4% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [MMMU-Pro](/benchmarks/mmmu-pro) | 80.4% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [ERQA](/benchmarks/erqa) | 64.7% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [SimpleVQA](/benchmarks/simplevqa) | 71.3% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [ScreenSpot Pro](/benchmarks/screenspot-pro) | 84.1% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [ZeroBench](/benchmarks/zerobench) | 33.0% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [MedXpertQA (MM)](/benchmarks/medxpertqamm) | 78.4% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [AA-MMMU-Pro](/benchmarks/aammmupro) | 80.5% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |

## Reasoning Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [ARC-AGI-2](/benchmarks/arc-agi-2) | 42.5% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [AA-LCR](/benchmarks/lcr) | 78.0% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |
| [CritPt](/benchmarks/critpt) | 11.3% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |

## Knowledge Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [GPQA-D](/benchmarks/gpqa-diamond) | 89.5% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [HLE](/benchmarks/hle) | 50.4% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [HLE w/o tools](/benchmarks/hlenotools) | 42.8% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [HealthBench Hard](/benchmarks/healthbench-hard) | 42.8% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [MedXpertQA (Text)](/benchmarks/medxpertqatext) | 52.6% | [Meta AI: Muse Spark launch benchmarks](https://ai.meta.com/blog/introducing-muse-spark-msl/) |
| [Artificial Analysis Intelligence Index](/benchmarks/artificialanalysis) | 31.3% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |
| [AA-GPQA Diamond](/benchmarks/aagpqadiamond) | 88.4% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |
| [AA-HLE](/benchmarks/aahle) | 40.7% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |
| [AA-Omniscience Index](/benchmarks/aaomniscienceindex) | 7.2% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |
| [AA-Omniscience Accuracy](/benchmarks/omniscienceaccuracy) | 49.6% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |
| [AA-Omniscience Hallucination Rate](/benchmarks/omnisciencehallucinationrate) | 84.2% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |
| [GPQA Diamond (Vals)](/benchmarks/valsgpqadiamond) | 89.6% | [Vals AI: GPQA Diamond leaderboard](https://www.vals.ai/models/meta_muse_spark) |
| [MMLU-Pro (Vals)](/benchmarks/valsmmlupro) | 87.3% | [Vals AI: MMLU Pro leaderboard](https://www.vals.ai/models/meta_muse_spark) |

## Instruction Following Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [AA-IFBench](/benchmarks/aaifbench) | 75.9% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark) |

## Mathematics Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [FrontierMath v2 (Tiers 1-3)](/benchmarks/frontiermathv2tiers13) | 39.000% | [Epoch AI FrontierMath v2 leaderboard](https://epoch.ai/benchmarks/frontiermath-tier-4-v2?view=graph&tab=leaderboard) |
| [FrontierMath v2 (Tier 4)](/benchmarks/frontiermathv2tier4) | 14.600% | [Epoch AI FrontierMath v2 leaderboard](https://epoch.ai/benchmarks/frontiermath-tier-4-v2?view=graph&tab=leaderboard) |

## Other Meta Models

- [Muse Spark 1.2](/models/muse-spark-1-2) - Score: 66.42
- [Muse Spark 1.1](/models/muse-spark-1-1) - Score: 65.93
- [Muse Glimmer 30B](/models/muse-glimmer-30b) - Score: 41.76
- [Llama 4 Scout](/models/llama-4-scout) - Score: 29.46
- [Llama 3.1 405B](/models/llama-3-1-405b) - Score: 28.7
- [Llama 4 Maverick](/models/llama-4-maverick) - Score: 22.74
- [Llama 3 70B](/models/llama-3-70b) - Score: 20.92
- [Muse Spark 1.3](/models/muse-spark-1-3) - Score: not computed
- [Llama 4 Behemoth](/models/llama-4-behemoth) - Score: not computed
- [Muse Voice Transcribe](/models/muse-voice-transcribe) - Score: not computed
