AA MMLU-Pro — leaderboard

Artificial Analysis independent evaluation of MMLU-Pro: 12,000 graduate-level questions across 14 subjects with 10 answer options. 280+ models tested.

Metric: Accuracy (%). Source: artificialanalysis.ai. Status: saturated. 345 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview) (High)89.76
2Claude Opus 4.5 (Thinking)89.45
3Claude Opus 4.5 (Non-reasoning)88.92
4Gemini 3 Flash (Preview) (Non-reasoning)88.22
5Claude Opus 4.1 (Thinking)87.99
6MiniMax-M2.187.49
7Claude Sonnet 4.5 (Thinking)87.45
8GPT-5.2 (xHigh)87.36
9Claude Opus 4 (Thinking)87.32
10GPT-5 (High)87.07
11GPT-5.1 (High)87.04
12GPT-5 (Medium)86.74
13Grok 486.58
14GPT-5 Codex (High)86.49
15DeepSeek V3.2 Speciale86.31

Interactive version: theaggregate.ai/benchmark?slug=aa-mmlu-pro · How the rankings work · Data refreshed daily, snapshot 2026-07-22.