SAD - Mini (Situating Prompt): leaderboard

Metric: Score (%, higher is better). Source: situational-awareness-dataset.org. 21 models tracked.

Top models

#ModelScore
1O1 Preview (2024-09-12)81.28
2O1 Mini (2024-09-12)75.77
3GPT-4 Preview (0125)72.79
4GPT-4 (0613)71.83
5Claude 3.5 Sonnet71.45
6GPT-4o71.35
7Claude 3 Opus70.85
8Llama 3 70B Chat69.16
9Claude 3 Sonnet65.58
10Claude 2.162.69
11Claude Instant 1.262.57
12GPT-4 Base62.2
13Claude 3 Haiku61.93
14Llama 2 70B Chat61.87
15Llama 2 70B58.54

Interactive version: theaggregate.ai/benchmark?slug=sad-mini-situating-prompt · How It Works · Data refreshed daily, snapshot 2026-09-19.