SeaEval - Cultural Reasoning - SG-Eval v2 Open (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Qwen 2 7B Instruct56.56
2SeaLLMs-v3-7B-Chat55
3gemma2-9B-cpt-sea-lionv3-instruct55
4Sailor2-8B-Chat54.36
5Qwen 2 72B Instruct54.08
6Gemma 2 9B (IT)53.96
7Qwen 2.5 72B Instruct53.32
8Qwen 2.5 32B Instruct53.2
9Qwen 2.5 14B Instruct53.2
10Gemma 2 2B (IT)52.08
11Llama 3.1 70B Cpt Sea Lionv3 Instruct51.92
12Llama 3.1 70B Instruct51.32
13Llama 3 8B Instruct51.12
14Llama 3 70B Instruct50.6
15Qwen 2.5 7B Instruct50.28

Interactive version: theaggregate.ai/benchmark?slug=seaeval-cultural-reasoning-sg-eval-v2-open-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.