SAD - Lite: leaderboard

Metric: Score (%, higher is better). Source: situational-awareness-dataset.org. 21 models tracked.

Top models

#ModelScore
1O1 Preview (2024-09-12)58.78
2Claude 3.5 Sonnet55.01
3O1 Mini (2024-09-12)52.07
4Claude 3 Opus51.02
5GPT-4o47.73
6Claude 3 Sonnet46.42
7Llama 3 70B Chat45.26
8Claude 2.144.82
9GPT-4 Preview (0125)44.65
10GPT-4 (0613)44.46
11Claude Instant 1.242.39
12Claude 3 Haiku41.04
13GPT-4 Base40.07
14Llama 2 70B Chat37.48
15GPT-3.5 Turbo (0613)36.89

Interactive version: theaggregate.ai/benchmark?slug=sad-lite · How It Works · Data refreshed daily, snapshot 2026-09-19.