MEGA-Bench Task - Multilingual Ruozhiba Explanation English — leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro79.3
2Gemini 2.0 Flash (Preview)72.9
3GPT-4o72.1
4InternVL3-38B70
5InternVL3-14B66.4
6InternVL3-78B65.7
7InternVL2.5-78B65.7
8Claude 3.5 Sonnet (20241022)62.1
9Qwen 2 VL 72B58.6
10Llama 4 Scout Base53.6
11Ovis2-8B52.9
12Claude 3.5 Sonnet (20240620)47.1
13InternVL3-8B45
14InternVL2-8B44.3
15Qwen 2 VL 7B40.7

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-multilingual-ruozhiba-explanation-english · How the rankings work · Data refreshed daily, snapshot 2026-07-22.