LongBench Pro - Hard - Thinking: leaderboard

Metric: Score (%). Source: arxiv.org. 46 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro81.03
2GPT-578.74
3Claude Sonnet 474.72
4Gemini 2.5 Flash72.19
5DeepSeek V3.267.73
6Qwen 3 235B A22B 2507 (Thinking)67.1
7DeepSeek V3.162.22
8Qwen 3 Next 80B A3B (Thinking)61.46
9Qwen 3 235B A22B 2507 Instruct58.6
10Claude 3.7 Sonnet56.58
11Qwen 3 Next 80B A3B Instruct54.74
12DeepSeek R1 052853.68
13DeepSeek R153.39
14Qwen 3 30B A3B 2507 (Thinking)52.76
15GLM-4.648.92

Interactive version: theaggregate.ai/benchmark?slug=longbench-pro-hard-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.