SeaEval - Cross-Lingual Consistency - Cross-MMLU (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 23 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct81.24
2Qwen 2.5 32B Instruct80.19
3Qwen 2 72B Instruct77.9
4Llama 3.1 70B Instruct76.38
5Llama 3 70B Instruct75.81
6Qwen 2.5 14B Instruct72.67
7gemma2-9B-cpt-sea-lionv3-instruct71.81
8Gemma 2 9B (IT)71.62
9Qwen 2.5 7B Instruct67.33
10Qwen 2 7B Instruct66.29
11SeaLLMs-v3-7B-Chat66.29
12Sailor2-8B-Chat65.43
13Llama 3.1 8B Instruct62
14Llama 3 8B Cpt Sea Lionv2.1 Instruct61.14
15Llama 3 8B Cpt Sea Lionv2 Instruct61.05

Interactive version: theaggregate.ai/benchmark?slug=seaeval-cross-lingual-consistency-cross-mmlu-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.