SeaEval - Fundamental NLP Tasks - QQP (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct83.15
2Qwen 2.5 32B Instruct83.15
3Llama 3.1 70B Cpt Sea Lionv3 Instruct82.95
4Qwen 2.5 14B Instruct82.55
5Sailor2-8B-Chat82.05
6Llama 3.1 70B Instruct81.5
7Qwen 2 72B Instruct80.65
8gemma2-9B-cpt-sea-lionv3-instruct80.3
9Llama 3 70B Instruct78.76
10Qwen 2 7B Instruct78.1
11Gemma 2 9B (IT)77.75
12SeaLLMs-v3-7B-Chat76.25
13Gemma 2 2B (IT)76.1
14Qwen 2.5 7B Instruct76
15Qwen 2.5 3B Instruct74.15

Interactive version: theaggregate.ai/benchmark?slug=seaeval-fundamental-nlp-tasks-qqp-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.