MEGA-Bench Task - Multilingual Ruozhiba Explanation English: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)79.3
2GPT-4o72.1
3InternVL3-38B70
4InternVL3-78B65.7
5InternVL2.5-78B65.7
6Claude 3.5 Sonnet (20241022)62.1
7Qwen 2 VL 72B58.6
8Llama 4 Scout Base53.6
9Claude 3.5 Sonnet (20240620)47.1
10InternVL3-8B45
11InternVL2-8B44.3
12Qwen 2 VL 7B40.7
13Gemma 3 12B (IT)36.4
14GPT-4o Mini32.9
15Gemma 3 4B (IT)28.6

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-multilingual-ruozhiba-explanation-english · How It Works · Data refreshed daily, snapshot 2026-09-05.