# Muse Spark 1.1 Benchmark Scores & Performance

> Muse Spark 1.1 by Meta scores 65.95/100 overall, ranking #31 out of 887 AI models.

Canonical page: https://benchlm.ai/models/muse-spark-1-1

Last updated: October 7, 2026

## Model Details

| Property | Value |
|----------|-------|
| Creator | Meta |
| Source Type | Proprietary |
| Reasoning Type | Reasoning |
| Context Window | 1M |
| Overall Score | 65.95/100 |
| Overall Rank | #31 of 887 |

## Family & Coverage

- Family: Muse Spark
- Variant: 1.1 (1.1)
- Benchmarks covered: 40 of 623
- Sibling models: [Muse Spark 1.2](/models/muse-spark-1-2), [Muse Spark](/models/muse-spark), [Muse Spark 1.3](/models/muse-spark-1-3)
- Related earlier model: [Muse Spark](/models/muse-spark)
- Coverage note: BenchLM currently has partial benchmark coverage for this model, so the overall score is conservative.

## Agentic Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [Terminal-Bench 2.1](/benchmarks/terminalbench21) | 80.0% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [MCP Atlas](/benchmarks/mcpatlas) | 88.1% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [Toolathlon](/benchmarks/toolathlon) | 75.6% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [OSWorld-Verified](/benchmarks/osworld-verified) | 80.8% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [WebArena-Verified](/benchmarks/webarena-verified) | 69% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [DeepSearchQA](/benchmarks/deepsearchqa) | 84.9% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [CyberGym](/benchmarks/cybergym) | 59.0% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [Finance Agent v2](/benchmarks/financeagentv2) | 57.2% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [deepSwe](/benchmarks/deepswe) | 53.3% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [OSWorld 2.0](/benchmarks/osworld2) | 14.2% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [JobBench](/benchmarks/jobbench) | 54.7% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [Cybench](/benchmarks/cybench) | 92.9% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [ExploitGym](/benchmarks/exploitgym) | 0.8% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [GDPval-AA](/benchmarks/gdpvalaanormalized) | 35.7% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark-1-1) |
| [GDPval-AA](/benchmarks/gdpvalaa) | 1375 | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [Terminal-Bench 2.1 (Vals)](/benchmarks/terminalbench21) | 69.3% | [Vals AI: Terminal-Bench 2.1 leaderboard](https://www.vals.ai/models/meta_muse_spark_1_1) |
| [AA Agentic Index](/benchmarks/aaagenticindex) | 27.5% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark-1-1) |

## Coding Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [Terminal-Bench 2.1](/benchmarks/terminalbench21) | 80.0% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [SWE-bench Pro](/benchmarks/swe-bench-pro) | 61.5% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [AA-SciCode](/benchmarks/aascicode) | 58.8% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark-1-1) |
| [LiveCodeBench (Vals)](/benchmarks/valslivecodebench) | 85.9% | [Vals AI: LiveCodeBench leaderboard](https://www.vals.ai/models/meta_muse_spark_1_1) |
| [SWE-bench (Vals)](/benchmarks/valsswebench) | 82.0% | [Vals AI: SWE-bench leaderboard](https://www.vals.ai/models/meta_muse_spark_1_1) |
| [AA Coding Index](/benchmarks/aacodingindex) | 71.3% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark-1-1) |

## Multimodal & Grounded Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [CharXiv](/benchmarks/charxiv) | 88.4% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [BabyVision](/benchmarks/babyvision) | 76.3% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [Design Arena Website](/benchmarks/designarenawebsite) | 1275 | [OpenRouter model benchmarks](https://openrouter.ai/meta/muse-spark-1.1/benchmarks) |

## Reasoning Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [MRCR 1M](/benchmarks/mrcr1m) | 54.1% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [AA-LCR](/benchmarks/lcr) | 77.7% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark-1-1) |
| [CritPt](/benchmarks/critpt) | 15.1% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark-1-1) |

## Knowledge Benchmarks

| Benchmark | Score | Source |
|-----------|-------|--------|
| [HLE](/benchmarks/hle) | 62.1% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [HLE w/o tools](/benchmarks/hlenotools) | 52.2% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [HealthBench Professional](/benchmarks/healthbenchprofessional) | 59.3% | [Meta AI: Muse Spark 1.1 evaluation report](https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report) |
| [Artificial Analysis Intelligence Index](/benchmarks/artificialanalysis) | 33.7% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark-1-1) |
| [AA-GPQA Diamond](/benchmarks/gpqa-diamond) | 89.8% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark-1-1) |
| [AA-HLE](/benchmarks/aahle) | 46.2% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark-1-1) |
| [AA-Omniscience Index](/benchmarks/aaomniscienceindex) | 28.1% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark-1-1) |
| [AA-Omniscience Accuracy](/benchmarks/omniscienceaccuracy) | 52.1% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark-1-1) |
| [AA-Omniscience Hallucination Rate](/benchmarks/omnisciencehallucinationrate) | 50.0% | [Artificial Analysis model benchmarks](https://artificialanalysis.ai/models/muse-spark-1-1) |
| [GPQA Diamond (Vals)](/benchmarks/gpqa-diamond) | 91.2% | [Vals AI: GPQA Diamond leaderboard](https://www.vals.ai/models/meta_muse_spark_1_1) |
| [MMLU-Pro (Vals)](/benchmarks/mmlu-pro) | 88.7% | [Vals AI: MMLU Pro leaderboard](https://www.vals.ai/models/meta_muse_spark_1_1) |

## Other Meta Models

- [Muse Spark 1.2](/models/muse-spark-1-2) - Score: 66.51
- [Muse Spark](/models/muse-spark) - Score: 60.05
- [Muse Glimmer 30B](/models/muse-glimmer-30b) - Score: 41.86
- [Llama 4 Scout](/models/llama-4-scout) - Score: 29.51
- [Llama 3.1 405B](/models/llama-3-1-405b) - Score: 28.77
- [Llama 4 Maverick](/models/llama-4-maverick) - Score: 22.78
- [Llama 3 70B](/models/llama-3-70b) - Score: 20.98
- [Muse Spark 1.3](/models/muse-spark-1-3) - Score: not computed
- [Llama 4 Behemoth](/models/llama-4-behemoth) - Score: not computed
- [Muse Voice Transcribe](/models/muse-voice-transcribe) - Score: not computed
