MEGA-Bench Task - Bongard Problem — leaderboard

Metric: Task Score (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1InternVL2.5-2B81.6
2Pixtral-12B34.2
3Claude 3.5 Sonnet (20240620)31.6
4Gemini 1.5 Flash (002)28.9
5InternVL2.5-78B24.6
6Claude 3.5 Sonnet (20241022)23.7
7MiniCPM-V-2.623.7
8GPT-4o21.1
9Qwen 2 VL 72B21.1
10Qwen 2 VL 7B21.1
11GPT-4o Mini18
12Gemini 1.5 Pro (002)15.8
13InternVL2-8B13.2
14Qwen 2 VL 2B10.5
15Aquila-VL-2B10.5

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-bongard-problem · How the rankings work · Data refreshed daily, snapshot 2026-07-22.