SeaEval: leaderboard

Southeast Asian multilingual and cultural reasoning benchmark covering cross-lingual QA, cultural reasoning, safety, and regional language understanding.

Metric: Average Score (%). Source: huggingface.co. Status: saturated. 30 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct72.61
2Qwen 2.5 32B Instruct70.56
3Qwen 2 72B Instruct70.53
4Qwen 2.5 14B Instruct69.6
5Llama 3.1 70B Instruct68.37
6Llama 3.1 70B67.78
7Llama 3.1 70B Cpt Sea Lionv3 Instruct66.98
8Llama 3 70B Instruct66.16
9Qwen 2.5 7B Instruct65.94
10gemma2-9B-cpt-sea-lionv3-instruct65.33
11Gemma 2 9B (IT)64.93
12Qwen 2 7B Instruct64.92
13Llama 3.1 8B Cpt Sea Lionv3 Instruct64.32
14SeaLLMs-v3-7B-Chat63.37
15Sailor2-8B-Chat59.95

Interactive version: theaggregate.ai/benchmark?slug=seaeval · How It Works · Data refreshed daily, snapshot 2026-09-05.