OpenEval - MMLU-Pro CoT — leaderboard

Metric: CoT Correctness (%). Source: huggingface.co. 43 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct69.31
2Qwen 3 4B Instruct66
3Gemma 3 27B (IT)65.7
4Qwen 2.5 32B Instruct64.19
5Qwen 2.5 14B Instruct61.79
6Gemma 3 12B (IT)55.2
7Qwen 2 72B Instruct48.45
8Gemma 2 27B (IT)42.03
9Qwen 2.5 7B Instruct40.92
10Qwen 1.5 32B Chat40.02
11Qwen 2.5 3B Instruct39.42
12Qwen 1.5 14B Chat34.6
13Qwen 2 7B Instruct28.08
14Gemma 1.1 7B (IT)27.98
15Gemma 2 9B (IT)25.08

Interactive version: theaggregate.ai/benchmark?slug=openeval-mmlu-pro-cot · How the rankings work · Data refreshed daily, snapshot 2026-07-22.