RealityTest — leaderboard

Metric: Text disclosure probability (self-reported). Source: benchmarklist.com. 17 models tracked.

Top models

#ModelScore
1Claude Haiku 4.592.3
2GPT-5.185.6
3Claude Opus 4.666
4Claude Sonnet 451.5
5Grok 441.3
6Gemma 4 31B31.3
7Gemini 3.1 Pro (Preview)30.5
8O4 Mini28.3
9Gemini 3 Flash (Preview)22.7
10DeepSeek V314.7
11Gemini 2.5 Pro12.8
12GPT-4o12.6
13Llama 3.3 70B Instruct12.5
14Mistral Large7.8

Interactive version: theaggregate.ai/benchmark?slug=realitytest · How the rankings work · Data refreshed daily, snapshot 2026-07-22.