AA MMLU-Pro: leaderboard

Artificial Analysis independent evaluation of MMLU-Pro: 12,000 graduate-level questions across 14 subjects with 10 answer options. 280+ models tested.

Metric: Accuracy (%). Source: artificialanalysis.ai. Status: saturated. 182 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview) (High)89.76
2Claude Opus 4.5 (Thinking)89.45
3Claude Opus 4.5 (Non-reasoning)88.92
4MiniMax-M2.187.49
5Claude Sonnet 4.5 (Thinking)87.45
6GPT-5 (High)87.07
7GPT-5.1 (High)87.04
8GPT-5 (Medium)86.74
9Grok 486.58
10GPT-5 Codex (High)86.49
11Gemini 2.5 Pro86.19
12Claude Sonnet 4.5 (Non-reasoning)85.99
13GPT-5 (Low)85.98
14GLM-4.7 (Reasoning)85.61
15Doubao Seed Code85.39

Interactive version: theaggregate.ai/benchmark?slug=aa-mmlu-pro · How It Works · Data refreshed daily, snapshot 2026-09-05.