Deception Effectiveness (Lechmazur) — leaderboard

Measures LLM capability to generate persuasive disinformation: models craft misleading arguments for incorrect answers to fact-based questions.

Metric: Deception Score. Source: github.com. Status: saturation imminent. 18 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet1.1
2Mistral Large 2 (Jul)1.09
3O1 Preview1.03
4Grok 20.96
5Gemini 1.5 Pro (Sept)0.94
6Llama 3.1 405B0.78
7Llama 3.1 70B0.71
8O1 Mini0.67
9Claude 3 Haiku0.66
10Claude 3 Opus0.65
11DeepSeek V2.50.61
12Gemini 1.5 Flash0.61
13GPT-4o0.6
14GPT-4 Turbo0.56
15Gemma 2 27B0.52

Interactive version: theaggregate.ai/benchmark?slug=deception-effectiveness-lechmazur · How the rankings work · Data refreshed daily, snapshot 2026-07-22.