# RefCOCO average (RefCOCO (avg))

> A referring-expression grounding benchmark averaged across RefCOCO variants to test whether a model can localize described objects correctly.

Canonical page: https://benchlm.ai/benchmarks/refcocoavg

- Category: [Multimodal & Grounded](/multimodal-grounded)
- Last updated: September 27, 2026

## About RefCOCO (avg)

- Year: 2026
- Tasks: Referring-expression grounding
- Format: Grounded visual localization
- Difficulty: Fine-grained visual grounding
- Paper: [RefCOCO referring expression datasets](https://github.com/lichengunc/refer)

RefCOCO-style tasks matter for grounding-heavy assistants because they measure whether the model can map language to specific objects or regions instead of only answering abstract questions. BenchLM stores provider-reported aggregate RefCOCO values as a display-only grounding row.

RefCOCO (avg) is currently displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Leaderboard (6 models)

| Rank | Model | Creator | Score |
|------|-------|---------|-------|
| 1 | [Qwen3.6-27B](/models/qwen3-6-27b) | Alibaba | 92.5% |
| 2 | [Qwen3.6-35B-A3B](/models/qwen3-6-35b-a3b) | Alibaba | 92.0% |
| 3 | [Nemotron 3 Nano Omni 30B A3B](/models/nemotron-3-nano-omni-30b-a3b) | NVIDIA | 90.5% |
| 4 | [LFM2.5-VL-3B](/models/lfm2-5-vl-3b) | LiquidAI | 87.9% |
| 5 | [ZAYA1-VL-8B](/models/zaya1-vl-8b) | Zyphra | 84.3% |
| 6 | [Interfaze Beta](/models/interfaze-beta) | Interfaze | 82.1% |

## FAQ

### What does RefCOCO (avg) measure?

A referring-expression grounding benchmark averaged across RefCOCO variants to test whether a model can localize described objects correctly.

### Which model scores highest on RefCOCO (avg)?

Qwen3.6-27B by Alibaba currently leads with a score of 92.5% on RefCOCO (avg).

### How many models are evaluated on RefCOCO (avg)?

6 AI models have been evaluated on RefCOCO (avg) on BenchLM.

### Does RefCOCO (avg) affect BenchLM's overall score?

Not directly. RefCOCO (avg) is still displayed on BenchLM for reference, but it is excluded from the weighted scoring formula.

## Compare Top Models on RefCOCO (avg)

- [Qwen3.6-27B vs Qwen3.6-35B-A3B](/compare/qwen3-6-27b-vs-qwen3-6-35b-a3b)
- [Qwen3.6-35B-A3B vs Nemotron 3 Nano Omni 30B A3B](/compare/nemotron-3-nano-omni-30b-a3b-vs-qwen3-6-35b-a3b)
- [Nemotron 3 Nano Omni 30B A3B vs LFM2.5-VL-3B](/compare/lfm2-5-vl-3b-vs-nemotron-3-nano-omni-30b-a3b)
- [LFM2.5-VL-3B vs ZAYA1-VL-8B](/compare/lfm2-5-vl-3b-vs-zaya1-vl-8b)
