ParseBench: leaderboard

Enterprise document parsing benchmark over tables, charts, layout, and content faithfulness for multimodal extraction systems.

Metric: Overall Score. Source: parsebench.ai. Status: years away from saturation. 64 models tracked.

Top models

#ModelScore
1Claude Fable 5.178.92
2Claude Fable 570.78
3GLM-5.3 Flash70.75
4Gemini 3.1 Pro (Preview)69.14
5GPT-5.567.76
6GPT-5.5 (Non-reasoning)64.39
7GPT-5.6 Terra (Non-reasoning)64.17
8Claude Opus 4.863.7
9Claude Opus 4.763.34
10Gemma 4 31B (IT)62.4
11GPT-5.4 (Non-reasoning)62.23
12Claude Sonnet 562.13
13GPT-5.6 Sol (Non-reasoning)62.12
14Qwen 3 VL 8B Instruct61.97
15Qwen 3.8 27B61.21

Interactive version: theaggregate.ai/benchmark?slug=parsebench · How It Works · Data refreshed daily, snapshot 2026-09-05.