Situational Awareness Dataset (SAD) (Situating Prompt): leaderboard

Metric: Score (%, higher is better). Source: situational-awareness-dataset.org. 21 models tracked.

Top models

#ModelScore
1O1 Preview (2024-09-12)61.93
2Claude 3.5 Sonnet57.13
3O1 Mini (2024-09-12)55.37
4Claude 3 Opus53.37
5GPT-4 Preview (0125)51.52
6GPT-4o50.72
7Claude 3 Sonnet50.01
8Llama 3 70B Chat49.34
9GPT-4 (0613)46.73
10Claude 2.146.19
11Claude 3 Haiku45.88
12Claude Instant 1.243.9
13Llama 2 70B Chat40.23
14GPT-4 Base39.29
15GPT-3.5 Turbo (0613)38.42

Interactive version: theaggregate.ai/benchmark?slug=situational-awareness-dataset-sad-situating-prompt · How It Works · Data refreshed daily, snapshot 2026-09-19.