MILU: leaderboard

Multilingual knowledge-and-reasoning evaluation reported in Anthropic's Claude Opus 4.8 system card.

Metric: Score (self-reported). Source: benchmarklist.com. Status: years away from saturation. 13 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)93.6
2Claude Fable 5.1 (Max)93
3Claude Fable 5 (Max)92.9
4Claude Mythos 592.9
5Claude Mythos Preview92.7
6Claude Opus 592.1
7Claude Opus 5 (Max)92.1
8Claude Opus 4.891.1
9GPT-5.490.6
10Claude Opus 4.789.9
11Claude Sonnet 4.689.4
12Claude Sonnet 589.3
13Claude Sonnet 5 (Max)89.3

Interactive version: theaggregate.ai/benchmark?slug=milu · How It Works · Data refreshed daily, snapshot 2026-09-05.