MEGA-Bench Task - Human Relationship Reasoning — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro100
2GPT-4o100
3Gemma 3 27B (IT)100
4Gemma 3 12B (IT)100
5InternVL3-78B100
6InternVL2-8B100
7Qwen 2 VL 72B100
8InternVL3-14B100
9Claude 3.5 Sonnet (20241022)100
10Pixtral-12B100
11InternVL2.5-78B100
12Claude 3.5 Sonnet (20240620)100
13Gemini 2.0 Flash (Preview)100
14MiniCPM-V-2.693.8
15Gemini 1.5 Pro (002)93.8

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-human-relationship-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.