SeaEval - Cultural Reasoning - SG-Eval v2 MCQ (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 22 models tracked.

Top models

#ModelScore
1Llama 3.1 70B Instruct87.64
2Qwen 2.5 72B Instruct86.18
3Qwen 2 72B Instruct85.82
4Qwen 2.5 32B Instruct84.36
5Llama 3 70B Instruct83.82
6Qwen 2.5 14B Instruct83.45
7Llama 3.1 8B Instruct81.27
8gemma2-9B-cpt-sea-lionv3-instruct80.91
9Gemma 2 9B (IT)80.36
10Llama 3 8B Instruct79.09
11SeaLLMs-v3-7B-Chat79.09
12Qwen 2 7B Instruct78.73
13Llama 3 8B Cpt Sea Lionv2.1 Instruct78.36
14Qwen 2.5 7B Instruct78
15Llama 3 8B Cpt Sea Lionv2 Instruct77.64

Interactive version: theaggregate.ai/benchmark?slug=seaeval-cultural-reasoning-sg-eval-v2-mcq-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.