LongBench v2 — leaderboard

LongBench v2: Measures long-context retrieval, needle finding, summarization, factual grounding, or retrieval-augmented generation quality.

Metric: Accuracy (%). Source: longbench2.github.io. Status: saturation imminent. 36 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro63.3
2Gemini 2.5 Flash62.1
3Qwen 3 235B A22B (Thinking)60.6
4DeepSeek R158.3
5Qwen 3 235B A22B 2507 Instruct58.3
6O1 Preview57.7
7DeepSeek R1 052856.7
8MiniMax-Text-0156.5
9Gemini 2.0 Flash (Thinking)56
10GPT-4o51.4
11Gemini 2.0 Flash51.1
12GLM-4.550.3
13Qwen 3 235B A22B50.1
14Qwen 3 30B A3B 2507 (Thinking)50.1
15Qwen 3 32B49.2

Interactive version: theaggregate.ai/benchmark?slug=longbench-v2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.