LongBench Pro - Extreme - Thinking: leaderboard

Metric: Score (%). Source: arxiv.org. 46 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro50.77
2GPT-548.37
3Gemini 2.5 Flash47.39
4Claude Sonnet 447.05
5DeepSeek V3.244.27
6Qwen 3 235B A22B 2507 (Thinking)43.39
7Qwen 3 235B A22B 2507 Instruct43.24
8DeepSeek V3.142.68
9Qwen 3 Next 80B A3B (Thinking)42.47
10DeepSeek R1 052841.49
11DeepSeek R140.76
12Qwen 3 Next 80B A3B Instruct40.47
13Qwen 3 30B A3B 2507 (Thinking)40.47
14Claude 3.7 Sonnet40.07
15GLM-4.638.88

Interactive version: theaggregate.ai/benchmark?slug=longbench-pro-extreme-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.