Clembench Text v3.0: leaderboard

Metric: clemscore. Source: benchmarklist.com. 31 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (High)90.1
2Claude Sonnet 4.587.42
3Claude Sonnet 4.5 (Low)86.01
4GPT-5.2 (High)84.19
5Gemini 3 Flash84.03
6GPT-5.281.66
7GPT-5.2 (Medium)79.61
8Kimi K2 (Thinking)77.79
9Kimi K2.5 (Non-reasoning)60.28
10Llama 3.3 70B Instruct50
11Qwen 2.5 72B Instruct48.07
12Llama 3.1 70B Instruct46.8
13Qwen 3 Next 80B A3B Instruct45.24
14Qwen 2.5 Coder 32B Instruct35.32
15Llama 3.1 8B Instruct25.28

Interactive version: theaggregate.ai/benchmark?slug=clembench-text-v3-0 · How It Works · Data refreshed daily, snapshot 2026-09-19.