SeaEval - Fundamental NLP Tasks - CoLA (Zero-Shot) — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 25 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct85.71
2Llama 3.1 70B Instruct85.04
3Qwen 2.5 32B Instruct84.28
4Llama 3 70B Instruct83.51
5Qwen 2 72B Instruct83.41
6Qwen 2.5 14B Instruct80.63
7Gemma 2 9B (IT)79.39
8Qwen 2.5 7B Instruct79.1
9Sailor2-8B-Chat79
10Qwen 2 7B Instruct78.72
11SeaLLMs-v3-7B-Chat78.52
12Qwen 2.5 1.5B Instruct74.98
13Gemma 2 2B (IT)67.5
14Qwen 2.5 3B Instruct66.44
15Llama 3 8B Instruct65.48

Interactive version: theaggregate.ai/benchmark?slug=seaeval-fundamental-nlp-tasks-cola-zero-shot · How the rankings work · Data refreshed daily, snapshot 2026-07-22.