LongBench Pro - Hard - Non-Thinking: leaderboard

Metric: Score (%). Source: arxiv.org. 34 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash57.87
2Claude Sonnet 457.57
3Qwen 3 235B A22B 2507 Instruct52.34
4DeepSeek V3.251.63
5Qwen 3 Next 80B A3B Instruct49.93
6DeepSeek V3.149.29
7DeepSeek V3 (0324)48.3
8Claude 3.7 Sonnet47.29
9GPT-4o44.88
10Kimi K2 090543.43
11GLM-4.643.07
12Qwen 3 30B A3B 2507 Instruct41.32
13GLM-4.540.21
14MiniMax-Text-0138.67
15Qwen 3 32B38.61

Interactive version: theaggregate.ai/benchmark?slug=longbench-pro-hard-non-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.