LongBench Pro - Overall - Non-Thinking: leaderboard

Metric: Score (%). Source: arxiv.org. 34 models tracked.

Top models

#ModelScore
1Claude Sonnet 456.07
2Gemini 2.5 Flash55.92
3Qwen 3 235B A22B 2507 Instruct52.51
4DeepSeek V3 (0324)51.7
5DeepSeek V3.251.67
6Qwen 3 Next 80B A3B Instruct51.54
7Claude 3.7 Sonnet51.45
8DeepSeek V3.151.39
9Kimi K2 090550.09
10GPT-4o46.67
11GLM-4.645.85
12Qwen 3 30B A3B 2507 Instruct43.84
13GLM-4.543.04
14MiniMax-Text-0141.14
15Qwen 3 32B40.28

Interactive version: theaggregate.ai/benchmark?slug=longbench-pro-overall-non-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.