Vellum - GPQA — leaderboard

Vellum's independently-run GPQA evaluation. Graduate-level science questions in physics, chemistry, and biology.

Metric: Accuracy (%). Source: www.vellum.ai. Status: saturated. 64 models tracked.

Top models

#ModelScore
1Claude Sonnet 596.2
2Claude 3 Opus95.4
3Gemini 3.1 Pro (Preview)94.3
4Claude Opus 4.794.2
5Claude Fable 594.1
6Claude Mythos 594.1
7GPT-5.593.6
8Claude Opus 4.893.6
9MiniMax-M393
10GPT-5.292.4
11Gemini 3 Pro91.9
12Claude Opus 4.691.3
13GLM-5.291.2
14Kimi K2.690.5
15DeepSeek V4 Pro90.1

Interactive version: theaggregate.ai/benchmark?slug=vellum-gpqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.