SeaEval - Fundamental NLP Tasks - OCNLI (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Qwen 2 72B Instruct78.2
2Qwen 2.5 32B Instruct77.42
3Qwen 2.5 72B Instruct76.85
4Qwen 2.5 14B Instruct75.39
5Llama 3.1 70B Cpt Sea Lionv3 Instruct69.56
6Qwen 2.5 7B Instruct67.32
7Qwen 2 7B Instruct65.42
8gemma2-9B-cpt-sea-lionv3-instruct64.88
9Llama 3.1 70B Instruct64.24
10Gemma 2 9B (IT)61.9
11Qwen 2.5 3B Instruct61.46
12Llama 3 70B Instruct59.29
13SeaLLMs-v3-7B-Chat56.98
14Sailor2-8B-Chat55.69
15Qwen 2.5 1.5B Instruct51.36

Interactive version: theaggregate.ai/benchmark?slug=seaeval-fundamental-nlp-tasks-ocnli-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.