SeaEval - Multilingual Reasoning - MMLU (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 22 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct81.29
2Llama 3.1 70B Instruct80.59
3Qwen 2.5 32B Instruct79.96
4Qwen 2 72B Instruct79.23
5Llama 3 70B Instruct76.5
6Qwen 2.5 14B Instruct75.42
7Gemma 2 9B (IT)71
8gemma2-9B-cpt-sea-lionv3-instruct70.79
9Qwen 2.5 7B Instruct69.35
10Qwen 2 7B Instruct67.25
11SeaLLMs-v3-7B-Chat66.7
12Llama 3.1 8B Instruct63.88
13Sailor2-8B-Chat62.02
14Llama 3 8B Cpt Sea Lionv2 Instruct61.31
15Qwen 2.5 3B Instruct61.19

Interactive version: theaggregate.ai/benchmark?slug=seaeval-multilingual-reasoning-mmlu-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.