DiagnosticIQ — leaderboard

Metric: Macro % D.IQ (self-reported). Source: benchmarklist.com. 33 models tracked.

Top models

#ModelScore
1Claude Opus 4.673.59
2GPT-5.473.27
3Gemini 3.1 Pro (Preview)72.74
4Claude 3.7 Sonnet70.61
5Qwen 3.6 35B A3B69.9
6DeepSeek V367.02
7GPT-565.89
8O165.41
9Gemma 4 31B65.06
10Claude Sonnet 4.664.84
11Llama 4 Maverick63.29
12Gemma 4 26B63.2
13Mistral Large63.15
14Claude Sonnet 462.52
15Gemini 2.0 Flash57.64

Interactive version: theaggregate.ai/benchmark?slug=diagnosticiq · How the rankings work · Data refreshed daily, snapshot 2026-07-22.