Spiral Bench (EQ-Bench): leaderboard

Tests whether models resist sycophancy and avoid reinforcing delusional thinking. 30 x 20-turn simulated chats judged by an ensemble of frontier models.

Metric: Delusion Score (0-100). Source: eqbench.com. Status: saturation imminent. 23 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.570.3
2GPT-5.270.2
3O363.4
4GPT-OSS-120B57.5
5GPT-557.4
6Kimi K257.2
7O4 Mini53.6
8Claude 3.5 Sonnet42.6
9Gemini 3 Pro (Preview)38.7
10Llama 4 Maverick38.2
11Grok 4 Fast37.5
12GPT-5 Chat36.6
13Gemini 2.5 Flash36.5
14Claude Sonnet 432.1
15GLM-4.630.8

Interactive version: theaggregate.ai/benchmark?slug=spiral-bench-eq-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.