SeaEval - Fundamental NLP Tasks - QNLI (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Llama 3.1 70B Cpt Sea Lionv3 Instruct92
2Qwen 2.5 72B Instruct90.83
3Qwen 2.5 14B Instruct90.79
4Gemma 2 9B (IT)90.7
5Qwen 2.5 32B Instruct90.63
6gemma2-9B-cpt-sea-lionv3-instruct90.55
7Llama 3.1 70B Instruct90.26
8Qwen 2 72B Instruct88.87
9Llama 3 70B Instruct87.68
10Qwen 2.5 7B Instruct86.53
11Qwen 2 7B Instruct81.55
12Gemma 2 2B (IT)77.92
13Qwen 2.5 3B Instruct76.46
14SeaLLMs-v3-7B-Chat71.59
15Sailor2-8B-Chat68.22

Interactive version: theaggregate.ai/benchmark?slug=seaeval-fundamental-nlp-tasks-qnli-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.