TMMLU+ - Other: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 21 models tracked.

Top models

#ModelScore
1Claude Opus 595.25
2GPT-5.6 Sol86.39
3Claude Fable 584.22
4DeepSeek V4 Pro (0813)83.92
5Claude Sonnet 581.9
6Gemini 3.1 Pro (Preview) (Thinking)81.76
7Hy380.5
8DeepSeek V4 Flash80.42
9GPT-5.6 Terra80.07
10Qwen 3.8 27B79.61
11Kimi K378.03
12Qwen 3.7 Max77.25
13GPT-5.6 Luna76.48
14GLM-5.275.42
15Grok 4.374.79

Interactive version: theaggregate.ai/benchmark?slug=tmmlu-plus-other · How It Works · Data refreshed daily, snapshot 2026-09-19.