Vellum - GPQA: leaderboard

Vellum's independently-run GPQA evaluation. Graduate-level science questions in physics, chemistry, and biology.

Metric: Accuracy (%). Source: www.vellum.ai. Status: saturated. 69 models tracked.

Top models

#ModelScore
1Claude Sonnet 596.2
2GPT-696
3Claude 3 Opus95.4
4GPT-5.6 Sol94.6
5Gemini 3.1 Pro (Preview)94.3
6Claude Opus 4.794.2
7Claude Fable 594.1
8Claude Mythos 594.1
9GPT-5.593.6
10Claude Opus 4.893.6
11Kimi K393.5
12MiniMax-M393
13GPT-5.6 Terra92.9
14GPT-5.292.4
15GPT-5.6 Luna92.3

Interactive version: theaggregate.ai/benchmark?slug=vellum-gpqa · How It Works · Data refreshed daily, snapshot 2026-09-05.