MEGA-Bench Task - Counting — leaderboard

Metric: Task Score (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20241022)85.7
2Qwen 2 VL 72B78.6
3InternVL2.5-78B78.6
4Gemini 1.5 Pro (002)71.4
5Claude 3.5 Sonnet (20240620)71.4
6GPT-4o64.3
7InternVL2-8B50
8Qwen 2 VL 7B42.9
9Pixtral-12B42.9
10Gemini 1.5 Flash (002)42.9
11Qwen 2 VL 2B35.7
12GPT-4o Mini35.7
13Aquila-VL-2B28.6
14MiniCPM-V-2.621.4
15InternVL2.5-2B14.3

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-counting · How the rankings work · Data refreshed daily, snapshot 2026-07-22.