MEGA-Bench Task - Multilingual Game Info Parsing: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Qwen 2 VL 72B88.4
2Gemini 2.5 Pro (Preview 03-25)85.7
3GPT-4o83
4Claude 3.5 Sonnet (20240620)83
5InternVL3-38B80.4
6GPT-4o Mini78.6
7InternVL2.5-78B77.7
8Qwen 2 VL 7B74.1
9InternVL3-8B73.2
10Claude 3.5 Sonnet (20241022)68.8
11InternVL3-78B67.9
12Gemma 3 12B (IT)67
13Gemma 3 4B (IT)60.7
14Gemma 3 27B (IT)58.9
15Llama 4 Scout Base54.5

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-multilingual-game-info-parsing · How It Works · Data refreshed daily, snapshot 2026-09-05.