MEGA-Bench Task - Code Execution: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)93.8
2GPT-4o75
3InternVL3-78B50
4GPT-4o Mini50
5Claude 3.5 Sonnet (20240620)50
6Gemma 3 27B (IT)43.8
7Gemini 1.5 Pro (002)43.8
8Gemini 1.5 Flash (002)43.8
9InternVL2.5-78B43.8
10Claude 3.5 Sonnet (20241022)37.5
11Gemma 3 12B (IT)25
12InternVL2-8B25
13Qwen 2 VL 72B25
14InternVL3-38B25
15Llama 4 Scout Base25

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-code-execution · How It Works · Data refreshed daily, snapshot 2026-09-05.