SynthDocBench: leaderboard

Metric: Accuracy (%) over all 1,788 questions: GPT-5 judge scores each answer 0 to 10 against a deterministic reference and an answer counts when the score is at least 6; pages rasterized at 144 DPI in 5-page strips, vision-only input, temperature 0; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 8 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)72.5
2Qwen 3 VL 235B A22B58.6
3GPT-5.442.3
4GPT-4o38.6
5InternVL3-78B38.3
6Claude Sonnet 4.531.4
7Qwen 2.5 VL 7B Instruct8.1

Interactive version: theaggregate.ai/benchmark?slug=synthdocbench · How It Works · Data refreshed daily, snapshot 2026-09-29.