COHERENCE: leaderboard

Metric: Exact-match accuracy (%): the whole image-to-placeholder assignment is right, over all 6,161 interleaved image-text documents whose images were removed: the model assigns each candidate image to its placeholder; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 19 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)71.82
2GPT-5.4 (High)71.29
3Claude Sonnet 4.6 (Thinking)65.72
4Qwen 3.5 397B A17B64.81
5Doubao-Seed-2.0-Pro-26021562.1
6Kimi K2.560.19
7Qwen 3.5 122B A10B59.57
8Qwen 3.5 35B A3B55.82
9GPT-5.252.46
10Qwen 3 VL 235B A22B46.32
11Qwen 3.5 4B45.64
12GLM-4.6V43.09
13Step3 VL 10B40.19
14Qwen 3 VL 8B Instruct35.45
15Qwen 3 VL 4B Instruct34.28

Interactive version: theaggregate.ai/benchmark?slug=coherence · How It Works · Data refreshed daily, snapshot 2026-10-07.