AA GPQA Diamond: leaderboard

Artificial Analysis independent evaluation of GPQA Diamond: 198 hardest graduate-level science questions where PhD experts achieve only 65%.

Metric: Accuracy (%). Source: artificialanalysis.ai. Status: saturated. 611 models tracked.

Top models

#ModelScore
1GPT-6 (xHigh)96.26
2GPT-6 (Max)96.06
3Gemini 3.8 Flash (High)95.25
4Grok 4.6 (High)94.95
5GPT-6 (High)94.95
6Gemini 3.7 Flash (High)94.55
7Gemini 3.1 Pro (Preview)94.14
8GPT-5.6 Sol (Max)94.14
9Muse Spark 1.3 (xHigh)94.14
10GPT-6 (Medium)93.94
11Muse Spark 1.3 (Max)93.84
12Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)93.74
13Claude Opus 5 (Adaptive Reasoning, High Effort)93.74
14Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)93.74
15GPT-5.5 (xHigh)93.54

Interactive version: theaggregate.ai/benchmark?slug=aa-gpqa-diamond · How It Works · Data refreshed daily, snapshot 2026-09-05.