SeaEval - Cultural Reasoning - US-Eval (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 25 models tracked.

Top models

#ModelScore
1Qwen 2 72B Instruct87.85
2Llama 3 70B Instruct86.92
3Llama 3.1 70B Cpt Sea Lionv3 Instruct86.92
4Qwen 2.5 72B Instruct85.98
5Llama 3.1 70B Instruct84.11
6Qwen 2.5 32B Instruct84.11
7Qwen 2.5 14B Instruct82.24
8Gemma 2 9B (IT)81.31
9gemma2-9B-cpt-sea-lionv3-instruct80.37
10Qwen 2.5 7B Instruct76.64
11Llama 3.1 8B Cpt Sea Lionv3 Instruct75.7
12Llama 3.1 8B Instruct72.9
13Qwen 2 7B Instruct72.9
14Llama 3 8B Cpt Sea Lionv2.1 Instruct71.03
15Llama 3 8B Instruct70.09

Interactive version: theaggregate.ai/benchmark?slug=seaeval-cultural-reasoning-us-eval-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.