SAD - Identity Leverage (Situating Prompt): leaderboard

Metric: Score (%, higher is better). Source: situational-awareness-dataset.org. 21 models tracked.

Top models

#ModelScore
1Claude 3 Sonnet78.46
2O1 Preview (2024-09-12)69.42
3Claude 3.5 Sonnet66.36
4Claude 3 Opus64.37
5Claude 3 Haiku62.6
6O1 Mini (2024-09-12)58.59
7Claude 2.154.12
8Llama 3 70B Chat43.93
9Claude Instant 1.243.86
10GPT-4o43.06
11GPT-4 Preview (0125)38.05
12Llama 2 70B Chat32.85
13GPT-3.5 Turbo (0613)31.12
14Llama 2 13B Chat25.26
15GPT-4 (0613)24.56

Interactive version: theaggregate.ai/benchmark?slug=sad-identity-leverage-situating-prompt · How It Works · Data refreshed daily, snapshot 2026-09-19.