MEGA-Bench Task - Code Output Result: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)85.7
2InternVL3-78B71.4
3InternVL3-38B71.4
4Claude 3.5 Sonnet (20241022)64.3
5Gemini 1.5 Pro (002)64.3
6Claude 3.5 Sonnet (20240620)64.3
7Gemma 3 27B (IT)57.1
8Gemma 3 12B (IT)57.1
9InternVL3-8B50
10Gemini 1.5 Flash (002)50
11GPT-4o42.9
12Qwen 2 VL 72B42.9
13InternVL2.5-78B42.9
14Pixtral-12B28.6
15Llama 4 Scout Base28.6

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-code-output-result · How It Works · Data refreshed daily, snapshot 2026-09-05.