SAD - Mini: leaderboard

Metric: Score (%, higher is better). Source: situational-awareness-dataset.org. 21 models tracked.

Top models

#ModelScore
1O1 Preview (2024-09-12)74.94
2O1 Mini (2024-09-12)70.97
3Claude 3 Opus66.74
4Claude 3.5 Sonnet66.49
5Claude 3 Sonnet61
6Llama 3 70B Chat60.64
7GPT-4 (0613)60.62
8GPT-4o59.44
9GPT-4 Preview (0125)57.66
10Claude 2.157.34
11GPT-4 Base57.16
12Claude Instant 1.256
13Claude 3 Haiku54.17
14Llama 2 70B Chat50.9
15Llama 2 70B49.59

Interactive version: theaggregate.ai/benchmark?slug=sad-mini · How It Works · Data refreshed daily, snapshot 2026-09-19.