MEGA-Bench: leaderboard

TIGER-Lab multimodal evaluation with 500+ tasks across vision-language understanding, generation, and reasoning with 44 models.

Metric: Overall Score (%). Source: huggingface.co. Status: saturated. 51 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)64.7
2O158
3Claude 3.5 Sonnet (20241022)54.3
4GPT-4o54.2
5Claude 3.5 Sonnet (20240620)52.1
6Gemini 1.5 Pro (002)49.6
7InternVL3-78B47.1
8Qwen 2 VL 72B46.8
9InternVL3-38B45.8
10InternVL2.5-78B45.6
11Gemini 1.5 Flash (002)43.8
12Gemma 3 27B (IT)43.7
13GPT-4o Mini43.1
14InternVL3-8B37.9
15Gemma 3 12B (IT)37.6

Interactive version: theaggregate.ai/benchmark?slug=mega-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.