SeaEval - Fundamental NLP Tasks - C3 (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 25 models tracked.

Top models

#ModelScore
1Llama 3.1 70B Cpt Sea Lionv3 Instruct96.41
2Qwen 2 72B Instruct96.11
3Llama 3.1 70B Instruct96.04
4Qwen 2.5 32B Instruct96.04
5Qwen 2.5 72B Instruct95.96
6Llama 3 70B Instruct95.21
7Qwen 2.5 14B Instruct95.03
8gemma2-9B-cpt-sea-lionv3-instruct92.56
9Qwen 2 7B Instruct92.45
10Gemma 2 9B (IT)92.22
11SeaLLMs-v3-7B-Chat91.44
12Qwen 2.5 7B Instruct91.21
13Sailor2-8B-Chat89.6
14Llama 3.1 8B Instruct88.15
15Llama 3 8B Cpt Sea Lionv2.1 Instruct86.76

Interactive version: theaggregate.ai/benchmark?slug=seaeval-fundamental-nlp-tasks-c3-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.