SeaEval - Multilingual Reasoning - IndoMMLU (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 21 models tracked.

Top models

#ModelScore
1Llama 3.1 70B Instruct67.41
2Qwen 2 72B Instruct63.86
3Qwen 2.5 72B Instruct63.81
4Llama 3 70B Instruct63.24
5Qwen 2.5 32B Instruct63.15
6gemma2-9B-cpt-sea-lionv3-instruct61.96
7Gemma 2 9B (IT)60.7
8Qwen 2.5 14B Instruct60.1
9Llama 3.1 8B Instruct56.05
10Qwen 2.5 7B Instruct56.01
11Qwen 2 7B Instruct53.86
12Llama 3 8B Cpt Sea Lionv2.1 Instruct52.69
13SeaLLMs-v3-7B-Chat52.67
14Llama 3 8B Instruct52.65
15Llama 3 8B Cpt Sea Lionv2 Instruct52.53

Interactive version: theaggregate.ai/benchmark?slug=seaeval-multilingual-reasoning-indommlu-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.