BenchCompass - Context-Grounded Reasoning (Closed Book): leaderboard

Metric: Accuracy (%). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1GPT-5.536.5
2Claude Opus 4.725
3DeepSeek V4 Pro16.7
4GLM-5.115.6
5Gemini 3.1 Pro (Preview)14.6
6Qwen 3.5 397B A17B14.6
7Gemma 4 31B (IT)9.4
8Qwen 3.5 122B A10B9.4
9MiniMax-M2.59.4
10Llama 4 Maverick8.3
11Mistral Large 38.3
12Gemma 4 26B A4B (IT)7.3
13Qwen 3 32B5.2
14Qwen 3 8B1

Interactive version: theaggregate.ai/benchmark?slug=benchcompass-context-grounded-reasoning-closed-book · How It Works · Data refreshed daily, snapshot 2026-09-20.