OCRBench-V2 (en) — leaderboard

OCRBench v2 English subset: Enhanced benchmark for evaluating Large Multimodal Models on visual text localization and reasoning with English text content.

Metric: Score (self-reported). Source: benchmarklist.com. Status: saturation imminent. 26 models tracked.

Top models

#ModelScore
1Qwen 3.7 Plus70.7
2Qwen 3.6 Plus67
3Gemini 3.1 Pro (Preview)64.6
4Qwen3 Omni 30B A3B Instruct61.3
5Gemini 2.5 Pro59.3
6GPT-5.459.1
7Qwen 3.5 9B58.7
8GPT-555.5
9Gemini 1.5 Pro51.6
10GPT-5.250.5
11Claude Opus 4.648.4
12Molmo2-8B44.7
13Ministral 3 14B43.3
14Phi-4 Multimodal Instruct38.1

Interactive version: theaggregate.ai/benchmark?slug=ocrbench-v2-en · How the rankings work · Data refreshed daily, snapshot 2026-07-22.