MEGA-Bench Task - Bongard Problem: leaderboard

Metric: Task Score (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1InternVL2.5-2B81.6
2Pixtral-12B34.2
3Claude 3.5 Sonnet (20240620)31.6
4Gemini 1.5 Flash (002)28.9
5InternVL2.5-78B24.6
6Claude 3.5 Sonnet (20241022)23.7
7GPT-4o21.1
8Qwen 2 VL 72B21.1
9Qwen 2 VL 7B21.1
10GPT-4o Mini18
11Gemini 1.5 Pro (002)15.8
12InternVL2-8B13.2
13Qwen 2 VL 2B10.5
14Aquila-VL-2B10.5

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-bongard-problem · How It Works · Data refreshed daily, snapshot 2026-09-05.