SeaEval - Multilingual Reasoning - ZBench (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 25 models tracked.

Top models

#ModelScore
1Qwen 2 7B Instruct72.73
2Qwen 2.5 72B Instruct69.7
3Qwen 2.5 7B Instruct66.67
4Qwen 2.5 14B Instruct66.67
5Qwen 2.5 32B Instruct60.61
6Qwen 2.5 3B Instruct57.58
7Qwen 2 72B Instruct57.58
8Llama 3.1 70B Cpt Sea Lionv3 Instruct57.58
9SeaLLMs-v3-7B-Chat54.55
10Llama 3 70B Instruct51.52
11Sailor2-8B-Chat51.52
12Llama 3.1 70B Instruct48.48
13Gemma 2 9B (IT)48.48
14Qwen 2.5 1.5B Instruct42.42
15gemma2-9B-cpt-sea-lionv3-instruct42.42

Interactive version: theaggregate.ai/benchmark?slug=seaeval-multilingual-reasoning-zbench-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.