OCRBench v2: leaderboard

OCRBench v2 evaluates large multimodal models on bilingual visual text localization and reasoning tasks.

Metric: Average (self-reported). Source: benchmarklist.com. Status: saturation imminent. 31 models tracked.

Top models

#ModelScore
1Qwen 3.5 9B64.1
2Gemini 3 Pro (Preview)63.8
3Gemini 2.5 Pro62.2
4Qwen3 Omni 30B A3B Instruct61.3
5Claude Opus 4.659.8
6GPT-5.252.6
7Molmo2-8B44.7
8Ministral 3 14B44
9Phi-4 Multimodal Instruct38.1

Interactive version: theaggregate.ai/benchmark?slug=ocrbench-v2 · How It Works · Data refreshed daily, snapshot 2026-09-05.