MEGA-Bench Task - TV Show Info Parsing — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro92.1
2Qwen 2 VL 72B90.5
3Claude 3.5 Sonnet (20241022)86.5
4GPT-4o82.5
5InternVL2.5-78B82.5
6InternVL3-78B81
7Llama 4 Scout Base80.2
8Gemini 2.0 Flash (Preview)80.2
9InternVL3-38B77
10Claude 3.5 Sonnet (20240620)77
11Gemma 3 27B (IT)76.2
12Ovis2-8B76.2
13Gemma 3 12B (IT)75.4
14GPT-4o Mini75.4
15Gemini 1.5 Flash (002)75.4

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-tv-show-info-parsing · How the rankings work · Data refreshed daily, snapshot 2026-07-22.