MEGA-Bench Task - Human Relationship Reasoning: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemma 3 27B (IT)100
2GPT-4o100
3Gemma 3 12B (IT)100
4InternVL3-78B100
5InternVL2-8B100
6Qwen 2 VL 72B100
7Claude 3.5 Sonnet (20241022)100
8Pixtral-12B100
9InternVL2.5-78B100
10Gemini 2.5 Pro (Preview 03-25)100
11Claude 3.5 Sonnet (20240620)100
12Gemini 1.5 Pro (002)93.8
13Gemini 1.5 Flash (002)93.8
14InternVL3-38B92.9
15Qwen 2 VL 7B87.5

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-human-relationship-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.