SeaEval - Fundamental NLP Tasks - MNLI (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Qwen 2.5 32B Instruct87.15
2Qwen 2.5 72B Instruct84.45
3Qwen 2.5 14B Instruct81.8
4Qwen 2.5 7B Instruct81.05
5Qwen 2 72B Instruct79.25
6Qwen 2.5 3B Instruct74.65
7gemma2-9B-cpt-sea-lionv3-instruct74.45
8Llama 3.1 70B Cpt Sea Lionv3 Instruct73.6
9Qwen 2 7B Instruct72.95
10Gemma 2 9B (IT)71.6
11Llama 3.1 70B Instruct70.15
12Llama 3 70B Instruct67.09
13Sailor2-8B-Chat66.4
14SeaLLMs-v3-7B-Chat65.3
15Gemma 2 2B (IT)61.85

Interactive version: theaggregate.ai/benchmark?slug=seaeval-fundamental-nlp-tasks-mnli-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.