Vals AI MMLU-Pro: leaderboard

Metric: Accuracy (%). Source: www.vals.ai. 138 models tracked.

Top models

#ModelScore
1Claude Fable 5.1 (Max)92.38
2Claude Opus 5 (Max)91.59
3Claude Fable 5 (Max)91.5
4Gemini 3.1 Pro (Preview) (High)90.99
5Gemini 3.8 Flash (High)90.22
6Gemini 3.7 Flash (High)90.12
7Gemini 3 Pro (Preview)90.1
8Claude Opus 4.7 (Max)89.87
9Claude Opus 4.8 (Max)89.58
10Gemini 3.5 Flash (High)89.52
11Grok 4.6 (High)89.4
12Qwen 3.7 Max89.31
13Gemini 3.6 Flash (High)89.28
14Grok 4.5 (High)89.22
15Claude Opus 4.6 (Adaptive Reasoning, Max Effort)89.11

Interactive version: theaggregate.ai/benchmark?slug=vals-ai-mmlu-pro · How It Works · Data refreshed daily, snapshot 2026-09-05.