MEGA-Bench - Skill: Language Understanding And Generation: leaderboard

Metric: Average Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)70.2
2GPT-4o61.6
3Claude 3.5 Sonnet (20241022)60.8
4Claude 3.5 Sonnet (20240620)57.5
5Gemini 1.5 Pro (002)55.3
6Qwen 2 VL 72B53.7
7GPT-4o Mini51.7
8InternVL3-78B50.8
9Gemini 1.5 Flash (002)49.8
10InternVL3-38B49.3
11InternVL2.5-78B49.3
12Gemma 3 27B (IT)47.2
13Gemma 3 12B (IT)44.4
14InternVL3-8B41.2
15Llama 4 Scout Base40.9

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-skill-language-understanding-and-generation · How It Works · Data refreshed daily, snapshot 2026-09-05.