MILU — leaderboard

Multilingual knowledge-and-reasoning evaluation reported in Anthropic's Claude Opus 4.8 system card.

Metric: Score (self-reported). Source: benchmarklist.com. Status: saturation imminent. 8 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)93.6
2Claude Mythos 592.9
3Claude Mythos Preview92.7
4Claude Opus 4.891.1
5GPT-5.490.6
6Claude Opus 4.789.9
7Claude Sonnet 4.689.4
8Claude Sonnet 589.3

Interactive version: theaggregate.ai/benchmark?slug=milu · How the rankings work · Data refreshed daily, snapshot 2026-07-22.