LongBench Pro - English - Thinking: leaderboard

Metric: Score (%). Source: arxiv.org. 46 models tracked.

Top models

#ModelScore
1GPT-573.24
2Gemini 2.5 Pro72.35
3Claude Sonnet 471.09
4DeepSeek V3.267.89
5Gemini 2.5 Flash67.22
6Qwen 3 235B A22B 2507 (Thinking)66.83
7DeepSeek V3.166.17
8Qwen 3 235B A22B 2507 Instruct63.88
9Qwen 3 Next 80B A3B (Thinking)62.91
10DeepSeek R162
11Claude 3.7 Sonnet60.49
12Qwen 3 Next 80B A3B Instruct60.3
13Qwen 3 30B A3B 2507 (Thinking)60.14
14DeepSeek R1 052859.9
15DeepSeek V3 (0324)58.14

Interactive version: theaggregate.ai/benchmark?slug=longbench-pro-english-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.