RealityTest: leaderboard

Metric: Text disclosure probability (self-reported). Source: benchmarklist.com. 17 models tracked.

Top models

#ModelScore
1Claude Haiku 4.592.3
2GPT-5.185.6
3Claude Opus 4.666
4Kimi K255.2
5Claude Sonnet 451.5
6Grok 441.3
7Gemma 4 31B31.3
8Gemini 3.1 Pro (Preview)30.5
9O4 Mini28.3
10DeepSeek R123.4
11Gemini 3 Flash22.7
12DeepSeek V314.7
13Gemini 2.5 Pro12.8
14GPT-4o12.6
15Llama 3.3 70B12.5

Interactive version: theaggregate.ai/benchmark?slug=realitytest · How It Works · Data refreshed daily, snapshot 2026-09-05.