NeedleBench — leaderboard

NeedleBench: Measures long-context retrieval, needle finding, summarization, factual grounding, or retrieval-augmented generation quality.

Metric: Overall 128K score (self-reported). Source: benchmarklist.com. Status: saturation imminent. 12 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct81.02
2Gemma 3 27B80.38
3Qwen 2.5 32B78.25
4Gemma 3 12B75.31
5Qwen 2.5 14B73.96
6Llama 3.1 70B72.37
7Llama 3.1 8B70.98
8Qwen 2.5 7B70.75
9GLM-4 9B Chat66.51
10Gemma 3 4B64.42

Interactive version: theaggregate.ai/benchmark?slug=needlebench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.