SeaEval - Fundamental NLP Tasks - WNLI (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 25 models tracked.

Top models

#ModelScore
1Qwen 2 72B Instruct88.73
2Qwen 2.5 32B Instruct87.32
3Llama 3.1 70B Cpt Sea Lionv3 Instruct85.92
4Llama 3.1 70B Instruct84.51
5Qwen 2.5 14B Instruct83.1
6Qwen 2.5 72B Instruct81.69
7Llama 3 70B Instruct78.87
8Gemma 2 9B (IT)77.46
9Qwen 2.5 7B Instruct76.06
10gemma2-9B-cpt-sea-lionv3-instruct76.06
11Llama 3.1 8B Cpt Sea Lionv3 Instruct73.24
12Qwen 2 7B Instruct71.83
13Qwen 2.5 3B Instruct64.79
14Llama 3.1 8B Instruct61.97
15SeaLLMs-v3-7B-Chat59.15

Interactive version: theaggregate.ai/benchmark?slug=seaeval-fundamental-nlp-tasks-wnli-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.