Vellum - Humanity's Last Exam — leaderboard

Vellum's independently-run Humanity's Last Exam evaluation. Expert-level questions across diverse academic domains.

Metric: Accuracy (%). Source: www.vellum.ai. Status: saturation imminent. 28 models tracked.

Top models

#ModelScore
1Claude Mythos 564.5
2Claude Opus 4.857.9
3Claude Sonnet 557.4
4GLM-5.254.7
5Kimi K2.654
6DeepSeek V4 Flash51.6
7DeepSeek V4 Pro48.2
8Gemini 3 Pro45.8
9Kimi K2 (Thinking)44.9
10Gemini 3.1 Pro (Preview)44.4
11GPT-5.5 Pro43.1
12GPT-5.541.4
13Gemini 3.5 Flash40.2
14Claude Opus 4.640
15GPT-535.2

Interactive version: theaggregate.ai/benchmark?slug=vellum-humanity-s-last-exam · How the rankings work · Data refreshed daily, snapshot 2026-07-22.