MEGA-Bench - Skill: Language Understanding And Generation — leaderboard

Metric: Average Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro70.2
2GPT-4o61.6
3Gemini 2.0 Flash (Preview)61.4
4Claude 3.5 Sonnet (20241022)60.8
5Claude 3.5 Sonnet (20240620)57.5
6Gemini 1.5 Pro (002)55.3
7Qwen 2 VL 72B53.7
8GPT-4o Mini51.7
9InternVL3-78B50.8
10Gemini 1.5 Flash (002)49.8
11InternVL3-38B49.3
12InternVL2.5-78B49.3
13Gemma 3 27B (IT)47.2
14InternVL3-14B46.4
15Gemma 3 12B (IT)44.4

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-skill-language-understanding-and-generation · How the rankings work · Data refreshed daily, snapshot 2026-07-22.