SynthDocBench - Chart Reading: leaderboard

Metric: Accuracy (%) on chart-reading questions: GPT-5 judge scores each answer 0 to 10 against a deterministic reference and an answer counts when the score is at least 6; pages rasterized at 144 DPI in 5-page strips, vision-only input, temperature 0; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 8 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)75.9
2Qwen 3 VL 235B A22B64.2
3GPT-4o45.7
4InternVL3-78B45.6
5GPT-5.442.5
6Claude Sonnet 4.535.3
7Qwen 2.5 VL 7B Instruct16.2

Interactive version: theaggregate.ai/benchmark?slug=synthdocbench-chart-reading · How It Works · Data refreshed daily, snapshot 2026-09-29.