SAD - Anti-Imitation (Situating Prompt): leaderboard

Metric: Score (%, higher is better). Source: situational-awareness-dataset.org. 21 models tracked.

Top models

#ModelScore
1O1 Preview (2024-09-12)29
2Claude 3.5 Sonnet26.2
3Llama 2 13B20.59
4GPT-4 Base16.82
5davinci-00215.39
6Llama 2 70B13.36
7Claude 3 Opus12.79
8GPT-4 Preview (0125)11.16
9GPT-4o10.88
10Claude 2.19.75
11Llama 2 7B9.07
12O1 Mini (2024-09-12)8
13GPT-4 (0613)7.55
14GPT-3.5 Turbo (0613)6.73
15Claude 3 Sonnet5.59

Interactive version: theaggregate.ai/benchmark?slug=sad-anti-imitation-situating-prompt · How It Works · Data refreshed daily, snapshot 2026-09-19.