BenchCompass - Context-Grounded Reasoning (Open Book): leaderboard

Metric: Accuracy (%). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)89.6
2Qwen 3.5 397B A17B84.4
3Qwen 3.5 122B A10B84.4
4GPT-5.582.3
5Gemma 4 31B (IT)82.3
6Claude Opus 4.782.3
7Gemma 4 26B A4B (IT)82.3
8DeepSeek V4 Pro81.3
9MiniMax-M2.575
10GLM-5.174
11Qwen 3 32B69.8
12Llama 4 Maverick68.8
13Mistral Large 364.6
14Qwen 3 8B58.3

Interactive version: theaggregate.ai/benchmark?slug=benchcompass-context-grounded-reasoning-open-book · How It Works · Data refreshed daily, snapshot 2026-09-20.