LLM Milgram Obedience - Baseline Full-Obedience Rate: leaderboard

Metric: Valid baseline sessions ending at 450 V (%; lower is less obedient). Source: github.com. 39 models tracked.

Top models

#ModelScore
1Llama 3.3 70B Instruct0
2Gemini 3.5 Flash0
3Claude Sonnet 50
4Qwen 3.8 Max0
5Gemini 3.7 Flash0
6Grok 4.60
7GPT-5.6 Luna (Non-reasoning)0
8GPT-5.6 Sol (Non-reasoning)0
9GPT-5.6 Terra (Non-reasoning)0
10MiMo-V2.5-Pro (Non-reasoning)10
11DeepSeek V3 (0324)11.11
12Nova Pro (v1)11.11
13DeepSeek V4 Flash (0731) (Non-reasoning)21.43
14Qwen 3.8 27B (Non-reasoning)26.67
15Gemini 2.5 Pro28.57

Interactive version: theaggregate.ai/benchmark?slug=llm-milgram-obedience-baseline-full-obedience-rate · How It Works · Data refreshed daily, snapshot 2026-09-19.