CorpusQA 1M: leaderboard
CorpusQA 1M is a long-context question answering benchmark evaluating models at approximately 1 million token contexts. Models are scored on accuracy when retrieving and reasoning over information distributed across an extremely long input corpus.
Source: huggingface.co.
Interactive version: theaggregate.ai/benchmark?slug=corpusqa-1m · How It Works · Data refreshed daily, snapshot 2026-09-05.