MEGA-Bench Task - Code Translation Python: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1GPT-4o64.6
2Claude 3.5 Sonnet (20240620)64.6
3Claude 3.5 Sonnet (20241022)60.4
4Gemma 3 27B (IT)50
5InternVL3-38B50
6Gemini 2.5 Pro (Preview 03-25)47.9
7Gemini 1.5 Pro (002)45.8
8Gemma 3 12B (IT)43.8
9InternVL3-78B43.8
10Qwen 2 VL 72B41.7
11Gemini 1.5 Flash (002)41.7
12InternVL2.5-78B41.7
13InternVL3-8B35.4
14GPT-4o Mini31.2
15Qwen 2 VL 7B25

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-code-translation-python · How It Works · Data refreshed daily, snapshot 2026-09-05.