LongBench Pro - Chinese - Thinking: leaderboard

Metric: Score (%). Source: arxiv.org. 46 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro74.49
2GPT-571.97
3Claude Sonnet 468.65
4DeepSeek V3.267.75
5Gemini 2.5 Flash67.59
6Qwen 3 235B A22B 2507 (Thinking)67.12
7DeepSeek V3.166.26
8Qwen 3 Next 80B A3B (Thinking)64.99
9DeepSeek R1 052863.89
10Qwen 3 235B A22B 2507 Instruct63.65
11Qwen 3 Next 80B A3B Instruct61.22
12GLM-4.659.92
13Qwen 3 30B A3B 2507 (Thinking)59.22
14Claude 3.7 Sonnet58.84
15DeepSeek R158.13

Interactive version: theaggregate.ai/benchmark?slug=longbench-pro-chinese-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.