MEGA-Bench Task - Code Programming Test Advanced — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)33.3
2Claude 3.5 Sonnet (20240620)24.1
3InternVL3-38B18.5
4Gemini 2.5 Pro13.9
5Llama 4 Scout Base13.9
6Ovis2-8B13
7Gemini 2.0 Flash (Preview)11.1
8Gemma 3 27B (IT)10.2
9GPT-4o5.6
10Gemini 1.5 Pro (002)5.6
11Qwen 2 VL 7B1.9
12Gemma 3 12B (IT)0
13Gemma 3 4B (IT)0
14InternVL3-78B0
15InternVL2-8B0

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-code-programming-test-advanced · How the rankings work · Data refreshed daily, snapshot 2026-07-22.