SeaEval - Fundamental NLP Tasks - RTE (Zero-Shot) — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 25 models tracked.

Top models

#ModelScore
1Qwen 2.5 32B Instruct90.97
2Qwen 2.5 72B Instruct90.25
3Qwen 2.5 14B Instruct86.64
4Qwen 2.5 7B Instruct85.92
5Llama 3.1 70B Instruct84.84
6Qwen 2 72B Instruct84.48
7Qwen 2 7B Instruct82.31
8Sailor2-8B-Chat81.23
9Llama 3 70B Instruct80.87
10SeaLLMs-v3-7B-Chat78.7
11Qwen 2.5 3B Instruct77.98
12Gemma 2 9B (IT)74.73
13Gemma 2 2B (IT)72.92
14Qwen 2.5 1.5B Instruct70.4
15Llama 3 8B Cpt Sea Lionv2.1 Instruct68.59

Interactive version: theaggregate.ai/benchmark?slug=seaeval-fundamental-nlp-tasks-rte-zero-shot · How the rankings work · Data refreshed daily, snapshot 2026-07-22.