LongBench Pro - Moderate - Thinking: leaderboard

Metric: Score (%). Source: arxiv.org. 46 models tracked.

Top models

#ModelScore
1GPT-582.31
2Gemini 2.5 Pro81.98
3Claude Sonnet 476.58
4Qwen 3 235B A22B 2507 (Thinking)75.12
5DeepSeek V3.275.08
6DeepSeek V3.173.53
7Gemini 2.5 Flash72.39
8Qwen 3 Next 80B A3B (Thinking)69.23
9Qwen 3 235B A22B 2507 Instruct68.15
10DeepSeek R1 052866.53
11Qwen 3 Next 80B A3B Instruct64.16
12Qwen 3 30B A3B 2507 (Thinking)62.55
13Claude 3.7 Sonnet61.56
14GLM-4.660.95
15MiniMax-M259.92

Interactive version: theaggregate.ai/benchmark?slug=longbench-pro-moderate-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.