MEGA-Bench Task - Vibe Eval Short Phrase — leaderboard

Metric: Task Score (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1GPT-4o28.6
2Claude 3.5 Sonnet (20241022)28.6
3Gemini 1.5 Flash (002)28.6
4Claude 3.5 Sonnet (20240620)28.6
5Qwen 2 VL 72B21.4
6Pixtral-12B21.4
7InternVL2.5-78B21.4
8InternVL2-8B14.3
9Qwen 2 VL 2B14.3
10Gemini 1.5 Pro (002)14.3
11InternVL2.5-2B14.3
12Qwen 2 VL 7B7.1
13GPT-4o Mini7.1
14Aquila-VL-2B0
15MiniCPM-V-2.60

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-vibe-eval-short-phrase · How the rankings work · Data refreshed daily, snapshot 2026-07-22.