MMLU-Pro: leaderboard

Enhanced MMLU benchmark with graduate-level questions across 14 subject areas and ten answer options.

Metric: Accuracy (%). Source: artificialanalysis.ai. 349 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview) (High)89.76
2Gemini 3 Pro (Preview) (Low)89.54
3Claude Opus 4.5 (Thinking)89.45
4Claude Opus 4.5 (Non-reasoning)88.92
5Gemini 3 Flash (Preview) (Non-reasoning)88.22
6Claude Opus 4.1 (Thinking)87.99
7MiniMax-M2.187.49
8Claude Sonnet 4.5 (Thinking)87.45
9GPT-5.2 (xHigh)87.36
10Claude Opus 4 (Thinking)87.32
11GPT-5 (High)87.07
12GPT-5.1 (High)87.04
13GPT-5 (Medium)86.74
14Grok 486.58
15GPT-5 Codex (High)86.49

Interactive version: theaggregate.ai/benchmark?slug=mmlu-pro-1foymq · How It Works · Data refreshed daily, snapshot 2026-10-09.