MEGA-Bench Task - Multilingual Ruozhiba Explanation Japanese: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)76.4
2GPT-4o65
3InternVL3-78B64.3
4InternVL3-38B62.9
5Qwen 2 VL 72B59.3
6Claude 3.5 Sonnet (20240620)57.1
7Claude 3.5 Sonnet (20241022)52.1
8Llama 4 Scout Base37.1
9Gemma 3 12B (IT)35.7
10Qwen 2 VL 7B35
11InternVL3-8B34.3
12Gemma 3 27B (IT)33.6
13Gemini 1.5 Flash (002)33.6
14Gemini 1.5 Pro (002)30
15InternVL2.5-78B28.6

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-multilingual-ruozhiba-explanation-japanese · How It Works · Data refreshed daily, snapshot 2026-09-05.