MEGA-Bench Task - Code Translation Hard: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1GPT-4o14.3
2Claude 3.5 Sonnet (20241022)10.7
3Gemini 2.5 Pro (Preview 03-25)3.6
4Gemma 3 27B (IT)0
5Gemma 3 12B (IT)0
6Gemma 3 4B (IT)0
7InternVL3-78B0
8InternVL3-8B0
9InternVL2-8B0
10Qwen 2 VL 72B0
11Qwen 2 VL 7B0
12InternVL3-38B0
13Qwen 2 VL 2B0
14Aquila-VL-2B0
15GPT-4o Mini0

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-code-translation-hard · How It Works · Data refreshed daily, snapshot 2026-09-05.