MEGA-Bench Task - Multilingual News QA — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 1.5 Pro (002)100
2Gemini 2.5 Pro92.9
3GPT-4o92.9
4Gemma 3 27B (IT)85.7
5Claude 3.5 Sonnet (20240620)85.7
6Gemma 3 12B (IT)78.6
7Claude 3.5 Sonnet (20241022)78.6
8Gemini 2.0 Flash (Preview)78.6
9Ovis2-8B71.4
10Pixtral-12B71.4
11InternVL3-78B64.3
12Qwen 2 VL 72B64.3
13InternVL3-14B64.3
14Gemini 1.5 Flash (002)64.3
15InternVL3-38B57.1

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-multilingual-news-qa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.