Context Arena MRCR (4-needle) — leaderboard

OpenAI MRCR benchmark: finds and distinguishes between 4 identical pieces of information in long conversations (8K–1M tokens). Harder variant requiring finer positional discrimination.

Metric: AUC@1M (%). Source: contextarena.ai. Status: saturation imminent. 50 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview) (High)68
2Gemini 3 Flash (Preview) (Medium)64.5
3Gemini 3.1 Pro (Preview) (Low)63.6
4Gemini 3.1 Pro (Preview) (High)61
5Gemini 3 Pro (Preview)57.3
6Gemini 3 Flash (Preview)50.4
7Gemini 2.5 Flash (Preview 05-20)49.5
8nova-2-lite-v147.5
9GPT-4.132.8
10GPT-4.1 Mini27.8
11Grok 4.1 Fast25.9
12GPT-5.2 (xHigh)22.6
13GPT-5.221.8
14Gemini 2.0 Flash (001)19.3
15Gemini 2.5 Flash Lite (Preview 09-2025)18.1

Interactive version: theaggregate.ai/benchmark?slug=context-arena-mrcr-4-needle · How the rankings work · Data refreshed daily, snapshot 2026-07-22.