LongBench Pro - Easy - Thinking: leaderboard

Metric: Score (%). Source: arxiv.org. 46 models tracked.

Top models

#ModelScore
1DeepSeek V3.185.72
2GPT-585.23
3DeepSeek V3.285.02
4Gemini 2.5 Pro84.4
5Claude Sonnet 483.78
6Qwen 3 235B A22B 2507 (Thinking)83.55
7Qwen 3 235B A22B 2507 Instruct82.98
8DeepSeek R1 052882.67
9DeepSeek R182.44
10Qwen 3 Next 80B A3B (Thinking)81.9
11Qwen 3 Next 80B A3B Instruct80.84
12Gemini 2.5 Flash79.82
13GLM-4.679.78
14Qwen 3 30B A3B 2507 (Thinking)79.64
15DeepSeek V3 (0324)79.2

Interactive version: theaggregate.ai/benchmark?slug=longbench-pro-easy-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.