SeaEval - Cultural Reasoning - CN-Eval (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 25 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct87.62
2Qwen 2.5 32B Instruct84.76
3Qwen 2 7B Instruct82.86
4Qwen 2.5 14B Instruct82.86
5Qwen 2 72B Instruct82.86
6SeaLLMs-v3-7B-Chat81.9
7Qwen 2.5 7B Instruct80
8Qwen 2.5 3B Instruct71.43
9Sailor2-8B-Chat71.43
10gemma2-9B-cpt-sea-lionv3-instruct59.05
11Gemma 2 9B (IT)58.1
12Qwen 2.5 1.5B Instruct55.24
13Llama 3.1 70B Cpt Sea Lionv3 Instruct55.24
14Llama 3.1 70B Instruct54.29
15Llama 3 70B Instruct53.33

Interactive version: theaggregate.ai/benchmark?slug=seaeval-cultural-reasoning-cn-eval-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.