GPQA Diamond: leaderboard

Graduate-level Google-Proof Q&A benchmark evaluating models on questions that require deep reasoning.

Metric: Accuracy (%). Source: www.vals.ai. Status: saturated. 138 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview) (High)95.45
2GPT-5.6 Sol (Max)95.2
3Grok 4.6 (High)94.7
4Gemini 3.8 Flash (High)94.44
5Gemini 3.7 Flash (High)93.94
6Qwen 3.8 Max93.69
7Claude Opus 593.43
8Gemini 3.6 Flash (High)93.43
9Claude Fable 5.1 (Max)93.43
10GPT-5.5 (xHigh)93.18
11Claude Fable 5 (Max)93.18
12Kimi K392.93
13Grok 4.5 (High)92.93
14MiniMax-M392.68
15Gemini 3.5 Flash (High)92.68

Interactive version: theaggregate.ai/benchmark?slug=gpqa-diamond · How It Works · Data refreshed daily, snapshot 2026-09-05.