MEGA-Bench Task - Code Match Problem — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro100
2GPT-4o100
3InternVL3-78B100
4InternVL3-38B100
5InternVL3-14B100
6Gemini 2.0 Flash (Preview)100
7Claude 3.5 Sonnet (20241022)92.9
8Gemini 1.5 Pro (002)92.9
9InternVL2.5-78B92.9
10Claude 3.5 Sonnet (20240620)92.9
11InternVL3-8B78.6
12Qwen 2 VL 72B78.6
13Gemini 1.5 Flash (002)78.6
14Gemma 3 27B (IT)71.4
15GPT-4o Mini71.4

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-code-match-problem · How the rankings work · Data refreshed daily, snapshot 2026-07-22.