SAD - Facts (Situating Prompt): leaderboard

Metric: Score (%, higher is better). Source: situational-awareness-dataset.org. 21 models tracked.

Top models

#ModelScore
1O1 Mini (2024-09-12)76.19
2GPT-4 Preview (0125)72.61
3O1 Preview (2024-09-12)72.49
4GPT-4o71.84
5GPT-4 (0613)69.62
6Claude 3.5 Sonnet67.53
7Claude 3 Sonnet67.13
8Claude 3 Opus66.54
9Llama 3 70B Chat64.11
10Claude 3 Haiku62.68
11GPT-4 Base62.12
12Claude 2.161.97
13Claude Instant 1.258.89
14Llama 2 70B Chat58.34
15GPT-3.5 Turbo (0613)57.26

Interactive version: theaggregate.ai/benchmark?slug=sad-facts-situating-prompt · How It Works · Data refreshed daily, snapshot 2026-09-19.