MEGA-Bench Task - Multilingual News QA: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 1.5 Pro (002)100
2GPT-4o92.9
3Gemini 2.5 Pro (Preview 03-25)92.9
4Gemma 3 27B (IT)85.7
5Claude 3.5 Sonnet (20240620)85.7
6Gemma 3 12B (IT)78.6
7Claude 3.5 Sonnet (20241022)78.6
8Pixtral-12B71.4
9InternVL3-78B64.3
10Qwen 2 VL 72B64.3
11Gemini 1.5 Flash (002)64.3
12InternVL3-38B57.1
13GPT-4o Mini57.1
14InternVL2.5-78B50
15InternVL3-8B42.9

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-multilingual-news-qa · How It Works · Data refreshed daily, snapshot 2026-09-05.