TMMLU+: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 21 models tracked.

Top models

#ModelScore
1Claude Opus 596.16
2GPT-5.6 Sol88.38
3Claude Fable 587.06
4DeepSeek V4 Pro (0813)86.42
5Claude Sonnet 584.66
6Gemini 3.1 Pro (Preview) (Thinking)84.26
7DeepSeek V4 Flash83.5
8Hy383.33
9GPT-5.6 Terra82.43
10Kimi K381
11Qwen 3.7 Max80.59
12Qwen 3.8 27B80.05
13GPT-5.6 Luna79.63
14GLM-5.278.59
15MiMo-V2.578.12

Interactive version: theaggregate.ai/benchmark?slug=tmmlu-plus · How It Works · Data refreshed daily, snapshot 2026-09-19.