SeaEval - Fundamental NLP Tasks - RTE (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 25 models tracked.

Top models

#ModelScore
1Qwen 2.5 32B Instruct90.97
2Qwen 2.5 72B Instruct90.25
3Llama 3.1 70B Cpt Sea Lionv3 Instruct88.81
4Qwen 2.5 14B Instruct86.64
5Qwen 2.5 7B Instruct85.92
6Llama 3.1 70B Instruct84.84
7gemma2-9B-cpt-sea-lionv3-instruct84.84
8Qwen 2 72B Instruct84.48
9Qwen 2 7B Instruct82.31
10Sailor2-8B-Chat81.23
11Llama 3 70B Instruct80.87
12SeaLLMs-v3-7B-Chat78.7
13Llama 3.1 8B Cpt Sea Lionv3 Instruct78.34
14Qwen 2.5 3B Instruct77.98
15Gemma 2 9B (IT)74.73

Interactive version: theaggregate.ai/benchmark?slug=seaeval-fundamental-nlp-tasks-rte-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.