MEGA-Bench Task - Multilingual Ruozhiba Explanation Spanish: leaderboard

Metric: Task Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)81.4
2GPT-4o71.4
3InternVL3-38B66.4
4Claude 3.5 Sonnet (20241022)60.7
5InternVL3-78B58.6
6InternVL2.5-78B57.1
7Claude 3.5 Sonnet (20240620)49.3
8InternVL3-8B45.7
9Qwen 2 VL 72B45.7
10Qwen 2 VL 7B41.4
11Gemma 3 12B (IT)38.6
12InternVL2-8B38.6
13Gemini 1.5 Pro (002)35
14Gemma 3 27B (IT)34.3
15Gemini 1.5 Flash (002)30.7

Interactive version: theaggregate.ai/benchmark?slug=mega-bench-task-multilingual-ruozhiba-explanation-spanish · How It Works · Data refreshed daily, snapshot 2026-09-05.