COHERENCE - Science: leaderboard

Metric: Exact-match accuracy (%) on the 1,361 science documents; 6,161 interleaved image-text documents whose images were removed: the model assigns each candidate image to its placeholder; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 19 models tracked.

Top models

#ModelScore
1GPT-5.4 (High)68.41
2Gemini 3.1 Pro (Preview)65.1
3Qwen 3.5 397B A17B60.32
4Claude Sonnet 4.6 (Thinking)58.93
5Kimi K2.552.09
6Doubao-Seed-2.0-Pro-26021549.01
7Qwen 3.5 122B A10B48.79
8Qwen 3.5 35B A3B44.09
9GPT-5.240.78
10Qwen 3 VL 235B A22B32.77
11Qwen 3.5 4B31.45
12GLM-4.6V29.83
13Step3 VL 10B26.6
14Qwen 3 VL 8B Instruct17.56
15Qwen 3 VL 4B Instruct17.19

Interactive version: theaggregate.ai/benchmark?slug=coherence-science · How It Works · Data refreshed daily, snapshot 2026-10-07.