LongBench Pro - Moderate - Non-Thinking: leaderboard

Metric: Score (%). Source: arxiv.org. 34 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash53.99
2Claude Sonnet 453.96
3Qwen 3 235B A22B 2507 Instruct53.14
4DeepSeek V3.251.36
5DeepSeek V3 (0324)49.68
6Kimi K2 090549.05
7DeepSeek V3.148.8
8Qwen 3 Next 80B A3B Instruct48.77
9Claude 3.7 Sonnet48.38
10GPT-4o43.03
11GLM-4.640.05
12Qwen 3 30B A3B 2507 Instruct39.04
13MiniMax-Text-0138.23
14GLM-4.536.92
15Qwen 3 32B34.3

Interactive version: theaggregate.ai/benchmark?slug=longbench-pro-moderate-non-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.