Deception Resistance (Lechmazur) — leaderboard

Measures LLM resilience to misleading arguments: models must maintain accurate reasoning when exposed to persuasive disinformation from other models.

Metric: Vulnerability Score (lower is better). Source: github.com. Status: saturation imminent. 18 models tracked.

Top models

#ModelScore
1Claude 3 Opus0.28
2Claude 3.5 Sonnet0.28
3O1 Preview0.32
4Mistral Large 2 (Jul)0.35
5O1 Mini0.5
6Llama 3.1 405B0.54
7Qwen 2.5 72B0.61
8GPT-4o0.61
9Gemini 1.5 Pro (Sept)0.62
10Gemini 1.5 Flash0.64
11Claude 3 Haiku0.78
12Grok 20.81
13Llama 3.1 70B0.82
14GPT-4o Mini1.07
15GPT-4 Turbo1.18

Interactive version: theaggregate.ai/benchmark?slug=deception-resistance-lechmazur · How the rankings work · Data refreshed daily, snapshot 2026-07-22.