MEGA-Bench Task - Constrained Generation Contain Length — leaderboard

Metric: Task Score (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1GPT-4o Mini86.7
2GPT-4o80
3Claude 3.5 Sonnet (20241022)73.3
4Qwen 2 VL 72B66.7
5InternVL2.5-78B66.7
6Gemini 1.5 Flash (002)40
7Qwen 2 VL 2B33.3
8Aquila-VL-2B33.3
9Gemini 1.5 Pro (002)33.3
10Pixtral-12B33.3
11Qwen 2 VL 7B26.7
12InternVL2.5-2B26.7
13InternVL2-8B6.7
14MiniCPM-V-2.60
15Claude 3.5 Sonnet (20240620)0

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-constrained-generation-contain-length · How the rankings work · Data refreshed daily, snapshot 2026-07-22.