SynthDocBench - Cross-Modal: leaderboard

Metric: Accuracy (%) on cross-modal text and chart questions: GPT-5 judge scores each answer 0 to 10 against a deterministic reference and an answer counts when the score is at least 6; pages rasterized at 144 DPI in 5-page strips, vision-only input, temperature 0; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 8 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)62.8
2Qwen 3 VL 235B A22B50.3
3GPT-5.438.7
4GPT-4o34.2
5InternVL3-78B29.6
6Claude Sonnet 4.525
7Qwen 2.5 VL 7B Instruct6.7

Interactive version: theaggregate.ai/benchmark?slug=synthdocbench-cross-modal · How It Works · Data refreshed daily, snapshot 2026-09-29.