SeaEval - Fundamental NLP Tasks - QNLI (Zero-Shot) — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct90.83
2Qwen 2.5 14B Instruct90.79
3Gemma 2 9B (IT)90.7
4Qwen 2.5 32B Instruct90.63
5Llama 3.1 70B Instruct90.26
6Qwen 2 72B Instruct88.87
7Llama 3 70B Instruct87.68
8Qwen 2.5 7B Instruct86.53
9Qwen 2 7B Instruct81.55
10Gemma 2 2B (IT)77.92
11Qwen 2.5 3B Instruct76.46
12SeaLLMs-v3-7B-Chat71.59
13Sailor2-8B-Chat68.22
14Qwen 2.5 1.5B Instruct61.49
15Llama 3.1 8B Instruct61.29

Interactive version: theaggregate.ai/benchmark?slug=seaeval-fundamental-nlp-tasks-qnli-zero-shot · How the rankings work · Data refreshed daily, snapshot 2026-07-22.