LongBench Pro - Overall - Thinking: leaderboard

Metric: Score (%). Source: arxiv.org. 46 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro73.42
2GPT-572.61
3Claude Sonnet 469.87
4DeepSeek V3.267.82
5Gemini 2.5 Flash67.41
6Qwen 3 235B A22B 2507 (Thinking)66.97
7DeepSeek V3.166.22
8Qwen 3 Next 80B A3B (Thinking)63.95
9Qwen 3 235B A22B 2507 Instruct63.77
10DeepSeek R1 052861.89
11Qwen 3 Next 80B A3B Instruct60.76
12DeepSeek R160.07
13Qwen 3 30B A3B 2507 (Thinking)59.68
14Claude 3.7 Sonnet59.66
15GLM-4.658.21

Interactive version: theaggregate.ai/benchmark?slug=longbench-pro-overall-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.