RefCOCO-avg: leaderboard

Average object-grounding score across RefCOCO, RefCOCO+, and RefCOCOg, measuring whether vision-language models localize referred objects.

Metric: Score (%). Source: llm-stats.com. Status: saturated. 9 models tracked.

Top models

#ModelScore
1Qwen 3.6 Plus93.5
2Qwen 3.6 27B92.5
3Qwen 3 VL 235B A22B (Thinking)92.4
4Qwen 3.6 35B A3B92
5Qwen 3.5 122B A10B91.3
6Qwen 3.5 27B90.9
7Qwen 3.5 35B A3B89.2

Interactive version: theaggregate.ai/benchmark?slug=refcoco-avg · How It Works · Data refreshed daily, snapshot 2026-09-05.