Context Arena MRCR (4-needle): leaderboard

OpenAI MRCR benchmark: finds and distinguishes between 4 identical pieces of information in long conversations (8K–1M tokens). Harder variant requiring finer positional discrimination.

Metric: AUC@1M (%). Source: contextarena.ai. Status: saturation imminent. 50 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview) (High)68
2Gemini 3 Flash (Preview) (Medium)64.5
3Gemini 3.1 Pro (Preview) (Low)63.6
4Gemini 3.1 Pro (Preview) (Medium)62.8
5Gemini 3.1 Pro (Preview) (High)61
6Gemini 3 Pro (Preview)57.3
7Gemini 3 Flash (Preview)50.4
8Gemini 2.5 Flash (Preview 05-20)49.5
9nova-2-lite-v147.5
10GPT-4.132.8
11GPT-4.1 Mini27.8
12Grok 4.1 Fast25.9
13GPT-5.2 (xHigh)22.6
14GPT-5.221.8
15Gemini 2.0 Flash (001)19.3

Interactive version: theaggregate.ai/benchmark?slug=context-arena-mrcr-4-needle · How It Works · Data refreshed daily, snapshot 2026-09-05.