SeaEval - Cultural Reasoning - SG-Eval (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 22 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct76.7
2Qwen 2.5 14B Instruct76.7
3Qwen 2 72B Instruct73.79
4Llama 3.1 70B Instruct71.84
5Qwen 2.5 32B Instruct71.84
6SeaLLMs-v3-7B-Chat71.84
7Llama 3 70B Instruct70.87
8Qwen 2 7B Instruct67.96
9gemma2-9B-cpt-sea-lionv3-instruct67.96
10Gemma 2 9B (IT)66.99
11Qwen 2.5 7B Instruct66.99
12Llama 3 8B Cpt Sea Lionv2.1 Instruct66.02
13Llama 3 8B Instruct65.05
14Llama 3 8B Cpt Sea Lionv2 Instruct65.05
15Llama 3.1 8B Instruct64.08

Interactive version: theaggregate.ai/benchmark?slug=seaeval-cultural-reasoning-sg-eval-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.