# Raw Qwen3 4B Instruct 2507 direct logits vs Muse Spark 1.1

> Side-by-side benchmark comparison for Raw Qwen3 4B Instruct 2507 direct logits and Muse Spark 1.1 across agentic, coding, multimodal, knowledge, reasoning, multilingual, and math tasks.

- Canonical page: https://benchlm.ai/compare/jevbench-raw-qwen3-4b-instruct-2507-vs-muse-spark-1-1
- Last updated: September 30, 2026

- Shared sourced benchmarks: 0
- HTML indexing: indexable
- Ranking lane: BenchAlign v5.8

## Quick Verdict

No benchmark verdict yet: there is no shared sourced benchmark row for Raw Qwen3 4B Instruct 2507 direct logits and Muse Spark 1.1.

## Summary

- Raw Qwen3 4B Instruct 2507 direct logits and Muse Spark 1.1 do not currently share a sourced benchmark row. The mirror therefore compares metadata, pricing, context windows, and each model's separately reported coverage without naming a benchmark winner.

## Model Snapshot

| Property | Raw Qwen3 4B Instruct 2507 direct logits | Muse Spark 1.1 |
|----------|----------|----------|
| Creator | Alibaba Qwen / neutral reproduction | Meta |
| Type | Open Weight | Proprietary |
| Reasoning | Non-Reasoning | Reasoning |
| Context | null | 1M |
| Independent public score (not head-to-head) | null | 66.6 |
| Benchmarks Covered | 2 | 26 |
| Pricing (input/output) | Pricing unavailable / Pricing unavailable | N/A |

## Category Breakdown

### Agentic

- Winner: Insufficient shared evidence
- Raw Qwen3 4B Instruct 2507 direct logits public-lane score: Coming soon
- Muse Spark 1.1 public-lane score: 56.9 (Supported · #28/119)

| Benchmark | Raw Qwen3 4B Instruct 2507 direct logits | Muse Spark 1.1 | Winner |
|-----------|-----------|-----------|--------|
| Terminal-Bench 2.1 | Coming soon | 80.0% | Coming soon |
| MCP Atlas | Coming soon | 88.1% | Coming soon |
| Toolathlon | Coming soon | 75.6% | Coming soon |
| OSWorld-Verified | Coming soon | 80.8% | Coming soon |
| WebArena-Verified | Coming soon | 69% | Coming soon |
| DeepSearchQA | Coming soon | 84.9% | Coming soon |
| CyberGym | Coming soon | 59.0% | Coming soon |
| Finance Agent v2 | Coming soon | 57.2% | Coming soon |
| deepSwe | Coming soon | 53.3% | Coming soon |
| OSWorld 2.0 | Coming soon | 14.2% | Coming soon |
| JobBench | Coming soon | 54.7% | Coming soon |
| Cybench | Coming soon | 92.9% | Coming soon |
| ExploitGym | Coming soon | 0.8% | Coming soon |
| Terminal-Bench 2.1 (Vals) | Coming soon | 69.3% | Coming soon |

### Coding

- Winner: Insufficient shared evidence
- Raw Qwen3 4B Instruct 2507 direct logits public-lane score: Coming soon
- Muse Spark 1.1 public-lane score: 55.4 (Supported · #32/144)

| Benchmark | Raw Qwen3 4B Instruct 2507 direct logits | Muse Spark 1.1 | Winner |
|-----------|-----------|-----------|--------|
| Terminal-Bench 2.1 | Coming soon | 80.0% | Coming soon |
| SWE-bench Pro | Coming soon | 61.5% | Coming soon |
| LiveCodeBench (Vals) | Coming soon | 85.9% | Coming soon |
| SWE-bench (Vals) | Coming soon | 82.0% | Coming soon |

### Reasoning

- Winner: Insufficient shared evidence
- Raw Qwen3 4B Instruct 2507 direct logits public-lane score: Coming soon
- Muse Spark 1.1 public-lane score: 75.7 (Unranked · 3 rankable rows)

| Benchmark | Raw Qwen3 4B Instruct 2507 direct logits | Muse Spark 1.1 | Winner |
|-----------|-----------|-----------|--------|
| JevBench 1.4 | 40.95 | Coming soon | Coming soon |
| JevBench 1.5 | 62.14 | Coming soon | Coming soon |
| MRCR 1M | Coming soon | 54.1% | Coming soon |

### Multimodal & Grounded

- Winner: Insufficient shared evidence
- Raw Qwen3 4B Instruct 2507 direct logits public-lane score: Coming soon
- Muse Spark 1.1 public-lane score: 78.3 (Unranked · 2 rankable rows)

| Benchmark | Raw Qwen3 4B Instruct 2507 direct logits | Muse Spark 1.1 | Winner |
|-----------|-----------|-----------|--------|
| CharXiv | Coming soon | 88.4% | Coming soon |
| BabyVision | Coming soon | 76.3% | Coming soon |

### Knowledge

- Winner: Insufficient shared evidence
- Raw Qwen3 4B Instruct 2507 direct logits public-lane score: Coming soon
- Muse Spark 1.1 public-lane score: 66.9 (Supported · #20/170)

| Benchmark | Raw Qwen3 4B Instruct 2507 direct logits | Muse Spark 1.1 | Winner |
|-----------|-----------|-----------|--------|
| HLE | Coming soon | 62.1% | Coming soon |
| HLE w/o tools | Coming soon | 52.2% | Coming soon |
| HealthBench Professional | Coming soon | 59.3% | Coming soon |
| GPQA Diamond (Vals) | Coming soon | 91.2% | Coming soon |
| MMLU-Pro (Vals) | Coming soon | 88.7% | Coming soon |

## FAQ

### Can I compare Raw Qwen3 4B Instruct 2507 direct logits and Muse Spark 1.1 on BenchLM yet?

Not fully yet. BenchLM is tracking both models, but sourced benchmark coverage is still incomplete for a fair score-level comparison.

### Why does this page show "coming soon" values?

BenchLM only calls winners when public benchmark coverage is available on both sides of the comparison.

## Related Comparisons

- [Raw Qwen3 4B Instruct 2507 direct logits vs Muse Spark 1.2](/compare/jevbench-raw-qwen3-4b-instruct-2507-vs-muse-spark-1-2)
- [Muse Spark 1.1 vs Muse Spark 1.2](/compare/muse-spark-1-1-vs-muse-spark-1-2)
- [Raw Qwen3 4B Instruct 2507 direct logits vs Muse Spark](/compare/jevbench-raw-qwen3-4b-instruct-2507-vs-muse-spark)
- [Muse Spark 1.1 vs Muse Spark](/compare/muse-spark-vs-muse-spark-1-1)

## Explore More

- [Raw Qwen3 4B Instruct 2507 direct logits profile](/models/jevbench-raw-qwen3-4b-instruct-2507)
- [Muse Spark 1.1 profile](/models/muse-spark-1-1)
- [Compare Pricing](/llm-pricing)
- [Alternative Finder](/tools/alternative-finder)
- [LLM Selector](/tools/llm-selector)
- [Overall Rankings](/best/overall)
