MEGA-Bench Task - Doc VQA — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)92.5
2Claude 3.5 Sonnet (20240620)87.5
3Gemini 2.5 Pro83.8
4GPT-4o Mini83.8
5Pixtral-12B83.1
6GPT-4o82.5
7Ovis2-8B81.9
8Gemini 1.5 Flash (002)81.9
9Llama 4 Scout Base81.9
10InternVL3-8B80.6
11InternVL3-14B80.6
12Gemini 1.5 Pro (002)80.6
13Qwen 2 VL 72B80
14InternVL2-8B78.8
15Gemma 3 12B (IT)76.9

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-doc-vqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.