SAD - Lite (Situating Prompt): leaderboard

Metric: Score (%, higher is better). Source: situational-awareness-dataset.org. 21 models tracked.

Top models

#ModelScore
1O1 Preview (2024-09-12)60.49
2Claude 3.5 Sonnet57.98
3O1 Mini (2024-09-12)54.68
4Claude 3 Opus53.97
5GPT-4 Preview (0125)52.94
6GPT-4o51.35
7Llama 3 70B Chat50.08
8GPT-4 (0613)48.83
9Claude 3 Sonnet48.5
10Claude 2.147.16
11Claude 3 Haiku45.55
12Claude Instant 1.244.05
13GPT-4 Base42.65
14Llama 2 70B Chat41.65
15GPT-3.5 Turbo (0613)40.52

Interactive version: theaggregate.ai/benchmark?slug=sad-lite-situating-prompt · How It Works · Data refreshed daily, snapshot 2026-09-19.