MEGA-Bench Task - Doc VQA: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)92.5
2Claude 3.5 Sonnet (20240620)87.5
3GPT-4o Mini83.8
4Gemini 2.5 Pro (Preview 03-25)83.8
5Pixtral-12B83.1
6GPT-4o82.5
7Gemini 1.5 Flash (002)81.9
8Llama 4 Scout Base81.9
9InternVL3-8B80.6
10Gemini 1.5 Pro (002)80.6
11Qwen 2 VL 72B80
12InternVL2-8B78.8
13Gemma 3 12B (IT)76.9
14InternVL3-78B76.9
15Gemma 3 27B (IT)75

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-doc-vqa · How It Works · Data refreshed daily, snapshot 2026-09-05.