MMMU Benchmark: leaderboard

Massive Multi-discipline Multimodal Understanding benchmark. Tests academic visual reasoning across 30 subjects spanning science, engineering, art, and more.

Metric: Validation Score. Source: mmmu-benchmark.github.io. Status: saturated. 189 models tracked.

Top models

#ModelScore
1Best Expert88.6
2GPT-5.185.4
3GPT-5 (Thinking)84.2
4Gemini 2.5 Pro (Thinking)84
5O382.9
6O4 Mini81.6
7Claude Opus 4.580.7
8Gemini 2.5 Flash (Preview 05-20)79.7
9Gemini 2.5 Pro (Preview 05-06)79.6
10Qwen 3 VL 235B A22B78.7
11O178.2
12Grok 378
13Claude Sonnet 4.577.8
14Intern-S177.7
15Claude Opus 4.177.1

Interactive version: theaggregate.ai/benchmark?slug=mmmu-benchmark · How It Works · Data refreshed daily, snapshot 2026-09-05.