TMMLU+ - Humanities: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 21 models tracked.

Top models

#ModelScore
1Claude Opus 594.6
2Claude Fable 590.02
3Gemini 3.1 Pro (Preview) (Thinking)84.91
4GPT-5.6 Sol82.3
5Claude Sonnet 581.72
6DeepSeek V4 Pro (0813)79.63
7DeepSeek V4 Flash77.42
8Kimi K377.31
9Qwen 3.7 Max76.03
10Hy374.75
11GPT-5.6 Terra72.49
12GPT-5.6 Luna70.81
13GLM-5.270.28
14Grok 4.367.67
15MiMo-V2.567.32

Interactive version: theaggregate.ai/benchmark?slug=tmmlu-plus-humanities · How It Works · Data refreshed daily, snapshot 2026-09-19.