MEGA-Bench Task - NExT-QA OE — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro47.4
2GPT-4o44.2
3Gemini 2.0 Flash (Preview)41.6
4InternVL2.5-78B40
5InternVL3-78B37.4
6InternVL3-14B36.8
7Claude 3.5 Sonnet (20240620)36.8
8Claude 3.5 Sonnet (20241022)36.3
9Aquila-VL-2B35.8
10Llama 4 Scout Base35.8
11Gemma 3 27B (IT)35.3
12Gemini 1.5 Pro (002)35.3
13Pixtral-12B35.3
14InternVL3-8B34.7
15Gemma 3 12B (IT)34.2

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-next-qa-oe · How the rankings work · Data refreshed daily, snapshot 2026-07-22.