LLM Stats (MMLU-Redux): leaderboard

Metric: Score (%). Source: llm-stats.com. 48 models tracked.

Top models

#ModelScore
1Kimi K2.6 (Thinking)95.3
2Claude Opus 4.6 (Thinking)95.2
3Qwen 3.7 Max95
4Qwen 3.5 397B A17B94.9
5DeepSeek V4 Pro (Reasoning, Max Effort)94.8
6Qwen 3.6 Plus94.5
7Qwen 3.7 Plus94.5
8GLM-5.1 (Thinking)94.3
9Qwen 3.5 122B A10B94
10Qwen 3 235B A22B 2507 (Thinking)93.8
11Qwen 3 VL 235B A22B (Thinking)93.7
12Qwen 3.6 27B93.5
13DeepSeek R1 052893.4
14Qwen 3.5 35B A3B93.3
15Qwen 3.6 35B A3B93.3

Interactive version: theaggregate.ai/benchmark?slug=llm-stats-mmlu-redux · How It Works · Data refreshed daily, snapshot 2026-09-05.