MEGA-Bench Task - Relative Depth Of Different Points — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1GPT-4o85.7
2Gemini 2.5 Pro78.6
3Claude 3.5 Sonnet (20241022)71.4
4InternVL2.5-78B71.4
5Claude 3.5 Sonnet (20240620)71.4
6Gemma 3 4B (IT)64.3
7InternVL3-78B64.3
8InternVL3-38B64.3
9InternVL3-14B64.3
10Ovis2-8B64.3
11Gemini 1.5 Pro (002)64.3
12Gemini 2.0 Flash (Preview)64.3
13Gemma 3 27B (IT)57.1
14Llama 4 Scout Base57.1
15InternVL3-8B50

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-relative-depth-of-different-points · How the rankings work · Data refreshed daily, snapshot 2026-07-22.