LongBench Pro - Chinese - Non-Thinking: leaderboard

Metric: Score (%). Source: arxiv.org. 34 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash56.54
2Claude Sonnet 454.99
3Qwen 3 235B A22B 2507 Instruct52.8
4DeepSeek V3.252.73
5Qwen 3 Next 80B A3B Instruct52.69
6DeepSeek V3.152.42
7DeepSeek V3 (0324)51.78
8Claude 3.7 Sonnet51
9Kimi K2 090550.29
10GLM-4.646.07
11GPT-4o45.66
12Qwen 3 30B A3B 2507 Instruct44.5
13GLM-4.543.02
14MiniMax-Text-0142.06
15Qwen 3 32B40.77

Interactive version: theaggregate.ai/benchmark?slug=longbench-pro-chinese-non-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.