SAD - Self-Recognition: leaderboard

Metric: Score (%, higher is better). Source: situational-awareness-dataset.org. 21 models tracked.

Top models

#ModelScore
1O1 Preview (2024-09-12)88.56
2O1 Mini (2024-09-12)76.47
3GPT-4o72
4Claude 3.5 Sonnet66.25
5Llama 3 70B Chat65.69
6Claude 3 Opus64.31
7Claude 2.162.19
8Claude Instant 1.259.81
9GPT-4 Preview (0125)59.19
10Llama 2 70B Chat54.13
11GPT-4 (0613)52.09
12Llama 2 13B Chat51.25
13GPT-3.5 Turbo (0613)51.06
14Claude 3 Haiku51
15davinci-00250.56

Interactive version: theaggregate.ai/benchmark?slug=sad-self-recognition · How It Works · Data refreshed daily, snapshot 2026-09-19.