MEGA-Bench Task - Graph Interpretation: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)92.8
2Claude 3.5 Sonnet (20240620)88.3
3Claude 3.5 Sonnet (20241022)86.2
4GPT-4o Mini83.8
5GPT-4o83.1
6Gemini 1.5 Pro (002)82.4
7InternVL3-78B82.1
8Gemma 3 27B (IT)80.3
9Llama 4 Scout Base80.3
10Gemini 1.5 Flash (002)79
11InternVL2.5-78B78.6
12InternVL3-38B77.6
13Qwen 2 VL 72B76.2
14Pixtral-12B74.5
15Gemma 3 12B (IT)72.8

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-graph-interpretation · How It Works · Data refreshed daily, snapshot 2026-09-05.