MEGA-Bench Task - TV Show Info Parsing: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)92.1
2Qwen 2 VL 72B90.5
3Claude 3.5 Sonnet (20241022)86.5
4GPT-4o82.5
5InternVL2.5-78B82.5
6InternVL3-78B81
7Llama 4 Scout Base80.2
8InternVL3-38B77
9Claude 3.5 Sonnet (20240620)77
10Gemma 3 27B (IT)76.2
11Gemma 3 12B (IT)75.4
12GPT-4o Mini75.4
13Gemini 1.5 Flash (002)75.4
14Qwen 2 VL 7B74.6
15Gemini 1.5 Pro (002)74.6

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-tv-show-info-parsing · How It Works · Data refreshed daily, snapshot 2026-09-05.