AA Long Context Reasoning: leaderboard

AA-LCR: ability to extract, reason about, and synthesize information from documents of 10k-100k tokens (100 questions). Proprietary AA benchmark.

Metric: Accuracy (%). Source: artificialanalysis.ai. Status: saturation imminent. 509 models tracked.

Top models

#ModelScore
1Kimi K3 (Max)88.67
2Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)85.33
3Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)84.67
4GPT-5.5 (xHigh)84.33
5GPT-5.5 (High)84.33
6Muse Spark 1.3 (Max)84.33
7GPT-5.6 Sol (Max)84
8Gemini 3.8 Flash (Medium)84
9GPT-5.6 Luna (Max)83.67
10Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)83.67
11Muse Glimmer 30B (High)83.33
12GPT-5.3 Codex (xHigh)83.33
13MiniMax-M383
14GPT-5.6 Terra (Max)83
15Muse Spark 1.3 (xHigh)83

Interactive version: theaggregate.ai/benchmark?slug=aa-long-context-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.