LLM Stats (MMLU-ProX): leaderboard

Metric: Score (%). Source: llm-stats.com. 32 models tracked.

Top models

#ModelScore
1Qwen 3.7 Max87
2Claude Opus 4.6 (Thinking)86.1
3Qwen 3.7 Plus85.4
4Qwen 3.6 Plus84.7
5Qwen 3.5 397B A17B84.7
6GLM-5.1 (Thinking)83.9
7DeepSeek V4 Pro (Reasoning, Max Effort)83.9
8Kimi K2.6 (Thinking)83.7
9Nemotron 3 Ultra83
10Qwen 3.5 27B82.2
11Qwen 3.5 122B A10B82.2
12Qwen 3.5 35B A3B81
13Qwen 3 235B A22B 2507 (Thinking)81
14Qwen 3 VL 235B A22B (Thinking)80.6
15Qwen 3 235B A22B 2507 Instruct79.4

Interactive version: theaggregate.ai/benchmark?slug=llm-stats-mmlu-prox · How It Works · Data refreshed daily, snapshot 2026-09-05.