SeaEval - Fundamental NLP Tasks - CoLA (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 25 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct85.71
2Llama 3.1 70B Instruct85.04
3Llama 3.1 70B Cpt Sea Lionv3 Instruct84.85
4Qwen 2.5 32B Instruct84.28
5Llama 3 70B Instruct83.51
6Qwen 2 72B Instruct83.41
7gemma2-9B-cpt-sea-lionv3-instruct82.55
8Qwen 2.5 14B Instruct80.63
9Gemma 2 9B (IT)79.39
10Qwen 2.5 7B Instruct79.1
11Sailor2-8B-Chat79
12Qwen 2 7B Instruct78.72
13SeaLLMs-v3-7B-Chat78.52
14Llama 3.1 8B Cpt Sea Lionv3 Instruct76.99
15Qwen 2.5 1.5B Instruct74.98

Interactive version: theaggregate.ai/benchmark?slug=seaeval-fundamental-nlp-tasks-cola-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.