# Claude Sonnet 5.5 vs Raw Qwen3 4B Instruct 2507 direct logits

> Side-by-side benchmark comparison for Claude Sonnet 5.5 and Raw Qwen3 4B Instruct 2507 direct logits across agentic, coding, multimodal, knowledge, reasoning, multilingual, and math tasks.

- Canonical page: https://benchlm.ai/compare/claude-sonnet-5-5-vs-jevbench-raw-qwen3-4b-instruct-2507
- Last updated: September 30, 2026

- Shared sourced benchmarks: 0
- HTML indexing: indexable
- Ranking lane: BenchAlign v5.8

## Quick Verdict

No benchmark verdict yet: there is no shared sourced benchmark row for Claude Sonnet 5.5 and Raw Qwen3 4B Instruct 2507 direct logits.

## Summary

- Claude Sonnet 5.5 and Raw Qwen3 4B Instruct 2507 direct logits do not currently share a sourced benchmark row. The mirror therefore compares metadata, pricing, context windows, and each model's separately reported coverage without naming a benchmark winner.

## Model Snapshot

| Property | Claude Sonnet 5.5 | Raw Qwen3 4B Instruct 2507 direct logits |
|----------|----------|----------|
| Creator | Anthropic | Alibaba Qwen / neutral reproduction |
| Type | Proprietary | Open Weight |
| Reasoning | Reasoning | Non-Reasoning |
| Context | 1M | null |
| Independent public score (not head-to-head) | 83.28 | null |
| Benchmarks Covered | 47 | 2 |
| Pricing (input/output) | $2.00 / $10.00 | Pricing unavailable / Pricing unavailable |

## Category Breakdown

### Agentic

- Winner: Insufficient shared evidence
- Claude Sonnet 5.5 public-lane score: 68 (Supported · #8/119)
- Raw Qwen3 4B Instruct 2507 direct logits public-lane score: Coming soon

| Benchmark | Claude Sonnet 5.5 | Raw Qwen3 4B Instruct 2507 direct logits | Winner |
|-----------|-----------|-----------|--------|
| Terminal-Bench 4.0 | 70.60% | Coming soon | Coming soon |
| HLE w/ tools | 64.5% | Coming soon | Coming soon |
| DRACO | 87.0% | Coming soon | Coming soon |
| Terminal-Bench-Science 0.1 | 59.9% | Coming soon | Coming soon |
| LAB all-pass (Harvey held-out) | 10.0% | Coming soon | Coming soon |
| LAB criterion-pass (Harvey held-out) | 93.1% | Coming soon | Coming soon |
| Toolathlon Verified Pass@3 | 85.2% | Coming soon | Coming soon |
| Toolathlon Verified Pass³ | 68.5% | Coming soon | Coming soon |
| Toolathlon Verified avg. turns | 31.6 turns | Coming soon | Coming soon |
| AutomationBench (Zapier 1.0.6) | 44.7% | Coming soon | Coming soon |
| Toolathlon-Verified | 77.8% | Coming soon | Coming soon |

### Coding

- Winner: Insufficient shared evidence
- Claude Sonnet 5.5 public-lane score: 85.6 (Supported · #1/144)
- Raw Qwen3 4B Instruct 2507 direct logits public-lane score: Coming soon

| Benchmark | Claude Sonnet 5.5 | Raw Qwen3 4B Instruct 2507 direct logits | Winner |
|-----------|-----------|-----------|--------|
| FrontierCode 1.1 Main | 46.2% | Coming soon | Coming soon |
| cursorBench40 | 55.5% | Coming soon | Coming soon |
| SWE-bench Pro | 81.3% | Coming soon | Coming soon |
| SWE Multilingual | 90.3% | Coming soon | Coming soon |
| SWE Multimodal | 54.3% | Coming soon | Coming soon |
| DeepSWE | 71.0% | Coming soon | Coming soon |
| FrontierCode 1.1 Extended | 59.1% | Coming soon | Coming soon |
| ProgramBench | 79.7% | Coming soon | Coming soon |
| FrontierSWE v2 | 61.9% | Coming soon | Coming soon |

### Reasoning

- Winner: Insufficient shared evidence
- Claude Sonnet 5.5 public-lane score: 79.2 (#8/27)
- Raw Qwen3 4B Instruct 2507 direct logits public-lane score: Coming soon

| Benchmark | Claude Sonnet 5.5 | Raw Qwen3 4B Instruct 2507 direct logits | Winner |
|-----------|-----------|-----------|--------|
| JevBench 1.4 | Coming soon | 40.95 | Coming soon |
| JevBench 1.5 | Coming soon | 62.14 | Coming soon |

### Multimodal & Grounded

- Winner: Insufficient shared evidence
- Claude Sonnet 5.5 public-lane score: 83.3 (Unranked · 7 rankable rows)
- Raw Qwen3 4B Instruct 2507 direct logits public-lane score: Coming soon

| Benchmark | Claude Sonnet 5.5 | Raw Qwen3 4B Instruct 2507 direct logits | Winner |
|-----------|-----------|-----------|--------|
| Chartography (no tools) | 61.6% | Coming soon | Coming soon |
| Chartography (tools) | 90.2% | Coming soon | Coming soon |
| BenchCAD Vision2Code (no tools) | 0.747 | Coming soon | Coming soon |
| BenchCAD Vision2Code (tools) | 0.963 | Coming soon | Coming soon |
| Biomedical image analysis | 72.2% | Coming soon | Coming soon |
| OfficeQA | 76.9% | Coming soon | Coming soon |
| OfficeQA Pro | 65.6% | Coming soon | Coming soon |

### Knowledge

- Winner: Insufficient shared evidence
- Claude Sonnet 5.5 public-lane score: 81.2 (Supported · #4/170)
- Raw Qwen3 4B Instruct 2507 direct logits public-lane score: Coming soon

| Benchmark | Claude Sonnet 5.5 | Raw Qwen3 4B Instruct 2507 direct logits | Winner |
|-----------|-----------|-----------|--------|
| HealthBench (raw) | 69.4% | Coming soon | Coming soon |
| HealthBench (length-adjusted) | 65.4% | Coming soon | Coming soon |
| HealthBench Professional (raw) | 77.1% | Coming soon | Coming soon |
| HealthBench Professional | 69.2% | Coming soon | Coming soon |
| BioMysteryBench (human-solvable) | 89.2% | Coming soon | Coming soon |
| BioMysteryBench (human-difficult) | 44.7% | Coming soon | Coming soon |
| SpatialBench Verified | 72.5% | Coming soon | Coming soon |
| SingleCellBench | 59.1% | Coming soon | Coming soon |
| Protein Design | 51.0% | Coming soon | Coming soon |
| Morphology-to-molecule matching | 25.0% | Coming soon | Coming soon |
| Medicinal chemistry | 65.3% | Coming soon | Coming soon |
| Protein Design library ranking | 54.8% | Coming soon | Coming soon |
| De novo protein-binder design | 82.3% | Coming soon | Coming soon |
| Protocols (troubleshooting) | 67.3% | Coming soon | Coming soon |
| Protocols (understanding) | 66.6% | Coming soon | Coming soon |
| HLE w/o tools | 56.9% | Coming soon | Coming soon |

### Multilingual

- Winner: Insufficient shared evidence
- Claude Sonnet 5.5 public-lane score: Coming soon
- Raw Qwen3 4B Instruct 2507 direct logits public-lane score: Coming soon

| Benchmark | Claude Sonnet 5.5 | Raw Qwen3 4B Instruct 2507 direct logits | Winner |
|-----------|-----------|-----------|--------|
| GMMLU | 92.1% | Coming soon | Coming soon |
| MILU | 91.6% | Coming soon | Coming soon |

### Mathematics

- Winner: Insufficient shared evidence
- Claude Sonnet 5.5 public-lane score: Coming soon
- Raw Qwen3 4B Instruct 2507 direct logits public-lane score: Coming soon

| Benchmark | Claude Sonnet 5.5 | Raw Qwen3 4B Instruct 2507 direct logits | Winner |
|-----------|-----------|-----------|--------|
| ArXivMath Aug. 2026 (no tools) | 86.8% | Coming soon | Coming soon |
| ArXivMath Aug. 2026 (tools) | 95.2% | Coming soon | Coming soon |

## FAQ

### Can I compare Claude Sonnet 5.5 and Raw Qwen3 4B Instruct 2507 direct logits on BenchLM yet?

Not fully yet. BenchLM is tracking both models, but sourced benchmark coverage is still incomplete for a fair score-level comparison.

### Why does this page show "coming soon" values?

BenchLM only calls winners when public benchmark coverage is available on both sides of the comparison.

## Related Comparisons

- [Claude Sonnet 5.5 vs GPT-6 Astra](/compare/claude-sonnet-5-5-vs-gpt-6-astra)
- [Raw Qwen3 4B Instruct 2507 direct logits vs GPT-6 Astra](/compare/gpt-6-astra-vs-jevbench-raw-qwen3-4b-instruct-2507)
- [Claude Sonnet 5.5 vs Claude Opus 5.5](/compare/claude-opus-5-5-vs-claude-sonnet-5-5)
- [Raw Qwen3 4B Instruct 2507 direct logits vs Claude Opus 5.5](/compare/claude-opus-5-5-vs-jevbench-raw-qwen3-4b-instruct-2507)

## Explore More

- [Claude Sonnet 5.5 profile](/models/claude-sonnet-5-5)
- [Raw Qwen3 4B Instruct 2507 direct logits profile](/models/jevbench-raw-qwen3-4b-instruct-2507)
- [Compare Pricing](/llm-pricing)
- [Alternative Finder](/tools/alternative-finder)
- [LLM Selector](/tools/llm-selector)
- [Overall Rankings](/best/overall)
