LongBench Pro - English - Non-Thinking: leaderboard

Metric: Score (%). Source: arxiv.org. 34 models tracked.

Top models

#ModelScore
1Claude Sonnet 457.14
2Gemini 2.5 Flash55.29
3Qwen 3 235B A22B 2507 Instruct52.22
4Claude 3.7 Sonnet51.89
5DeepSeek V3 (0324)51.62
6DeepSeek V3.250.61
7Qwen 3 Next 80B A3B Instruct50.39
8DeepSeek V3.150.35
9Kimi K2 090549.9
10GPT-4o47.67
11GLM-4.645.64
12Qwen 3 30B A3B 2507 Instruct43.17
13GLM-4.543.05
14Llama 3.1 405B Instruct42.03
15MiniMax-Text-0140.21

Interactive version: theaggregate.ai/benchmark?slug=longbench-pro-english-non-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.