Inverse Turing Bench: leaderboard

Metric: Accuracy (self-reported). Source: benchmarklist.com. 29 models tracked.

Top models

#ModelScore
1Claude Opus 4.6 (Adaptive Reasoning, Max Effort)77.92
2Claude Opus 4.6 (Thinking)77.56
3GPT-5.5 (High)75.94
4GPT-5.5 (Low)74.87
5GPT-5.4 (High)68.22
6GPT-5.1 (High)67.68
7GPT-5.4 (Low)64.45
8Claude Sonnet 4.6 (Thinking)63.2
9GPT-5.1 (Low)63.02
10Claude Opus 4.1 (Thinking)60.14
11Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)58.35
12Kimi K2.657.45
13Kimi K2.6 (Thinking)55.3
14GPT-4 (0613)48.29
15Claude Haiku 4.5 (Thinking)47.04

Interactive version: theaggregate.ai/benchmark?slug=inverse-turing-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.