SAD - Introspection: leaderboard

Metric: Score (%, higher is better). Source: situational-awareness-dataset.org. 21 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet39.1
2GPT-4 (0613)38.32
3Llama 2 7B37.95
4Llama 2 13B35.02
5Llama 3 70B Chat34.81
6GPT-4 Base34.42
7GPT-4 Preview (0125)34.09
8Claude 3 Opus33.64
9Claude Instant 1.230.27
10Claude 3 Sonnet30.18
11GPT-4o29.64
12O1 Preview (2024-09-12)27.93
13Claude 3 Haiku27.6
14O1 Mini (2024-09-12)26.58
15Claude 2.126.01

Interactive version: theaggregate.ai/benchmark?slug=sad-introspection · How It Works · Data refreshed daily, snapshot 2026-09-19.