Vellum - MMMLU — leaderboard

Vellum's independently-run Multilingual MMLU evaluation. Knowledge questions across multiple languages.

Metric: Accuracy (%). Source: www.vellum.ai. Status: saturated. 23 models tracked.

Top models

#ModelScore
1Gemini 3 Pro91.8
2Claude Opus 4.691.1
3Claude Opus 4.590.8
4Claude Opus 4.189.5
5Claude Sonnet 4.689.3
6Gemini 2.5 Pro89.2
7Claude Sonnet 4.589.1
8Claude Opus 488.8
9O187.7
10GPT-4.187.3
11Claude Sonnet 486.5
12Claude 3.7 Sonnet (Thinking)86.1
13GPT-4.585.1
14Llama 4 Maverick84.6
15Claude 3.7 Sonnet83.2

Interactive version: theaggregate.ai/benchmark?slug=vellum-mmmlu · How the rankings work · Data refreshed daily, snapshot 2026-07-22.