MEGA-Bench Task - Relative Depth Of Different Points: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1GPT-4o85.7
2Gemini 2.5 Pro (Preview 03-25)78.6
3Claude 3.5 Sonnet (20241022)71.4
4InternVL2.5-78B71.4
5Claude 3.5 Sonnet (20240620)71.4
6Gemma 3 4B (IT)64.3
7InternVL3-78B64.3
8InternVL3-38B64.3
9Gemini 1.5 Pro (002)64.3
10Gemma 3 27B (IT)57.1
11Llama 4 Scout Base57.1
12InternVL3-8B50
13Gemini 1.5 Flash (002)50
14Gemma 3 12B (IT)42.9
15Qwen 2 VL 72B42.9

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-relative-depth-of-different-points · How It Works · Data refreshed daily, snapshot 2026-09-05.