MEGA-Bench Task - Position Relationship — leaderboard

Metric: Task Score (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)86.7
2InternVL2.5-78B80
3GPT-4o73.3
4Gemini 1.5 Pro (002)73.3
5InternVL2-8B66.7
6Qwen 2 VL 72B66.7
7GPT-4o Mini66.7
8Gemini 1.5 Flash (002)60
9Pixtral-12B53.3
10InternVL2.5-2B53.3
11Qwen 2 VL 2B46.7
12Aquila-VL-2B46.7
13Claude 3.5 Sonnet (20240620)46.7
14Qwen 2 VL 7B33.3
15MiniCPM-V-2.613.3

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-position-relationship · How the rankings work · Data refreshed daily, snapshot 2026-07-22.