MMMU Benchmark — leaderboard

Massive Multi-discipline Multimodal Understanding benchmark. Tests academic visual reasoning across 30 subjects spanning science, engineering, art, and more.

Metric: Validation Score. Source: mmmu-benchmark.github.io. Status: saturated. 189 models tracked.

Top models

#ModelScore
1Human Expert88.6
2GPT-5.185.4
3GPT-5 (Thinking)84.2
4O382.9
5O4 Mini81.6
6Claude Opus 4.580.7
7Gemini 2.5 Flash (Preview 05-20)79.7
8Qwen 3 VL 235B A22B78.7
9O178.2
10Grok 378
11Claude Sonnet 4.577.8
12Intern-S177.7
13Claude Opus 4.177.1
14Claude Opus 476.5
15Claude 3.7 Sonnet75

Interactive version: theaggregate.ai/benchmark?slug=mmmu-benchmark · How the rankings work · Data refreshed daily, snapshot 2026-07-22.