SeaEval - Cultural Reasoning - SG-Eval v1 Cleaned (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 22 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct72.06
2Qwen 2.5 14B Instruct69.12
3Qwen 2 72B Instruct67.65
4Llama 3.1 70B Instruct66.18
5Llama 3 70B Instruct66.18
6Llama 3 8B Cpt Sea Lionv2.1 Instruct66.18
7Llama 3 8B Cpt Sea Lionv2 Instruct66.18
8Qwen 2.5 32B Instruct64.71
9Qwen 2 7B Instruct63.24
10Gemma 2 9B (IT)60.29
11gemma2-9B-cpt-sea-lionv3-instruct60.29
12Llama 3 8B Instruct58.82
13Qwen 2.5 7B Instruct58.82
14Qwen 2.5 3B Instruct58.82
15SeaLLMs-v3-7B-Chat58.82

Interactive version: theaggregate.ai/benchmark?slug=seaeval-cultural-reasoning-sg-eval-v1-cleaned-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.