SeaEval - Fundamental NLP Tasks - MRPC (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Qwen 2 72B Instruct80.64
2Qwen 2.5 72B Instruct80.15
3Qwen 2 7B Instruct78.68
4Qwen 2.5 14B Instruct77.94
5gemma2-9B-cpt-sea-lionv3-instruct77.94
6Sailor2-8B-Chat77.7
7Qwen 2.5 32B Instruct77.45
8Llama 3.1 70B Cpt Sea Lionv3 Instruct77.45
9Llama 3.1 70B Instruct76.96
10Llama 3 70B Instruct75.98
11SeaLLMs-v3-7B-Chat74.75
12Gemma 2 9B (IT)74.02
13Gemma 2 2B (IT)70.83
14Qwen 2.5 7B Instruct70.59
15Qwen 2.5 1.5B Instruct68.38

Interactive version: theaggregate.ai/benchmark?slug=seaeval-fundamental-nlp-tasks-mrpc-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.