OpenEval - MMLU-Pro CoT: leaderboard

Metric: CoT Correctness (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct69.3
2Qwen 3 4B Instruct66
3Qwen 2.5 32B Instruct64.3
4Qwen 2.5 72B Instruct Turbo63.1
5Qwen 2.5 14B Instruct61.9
6Qwen 2.5 7B Instruct Turbo53.9
7Qwen 2 72B Instruct48.5
8Qwen 2.5 7B Instruct40.9
9Qwen 1.5 32B Chat40.1
10Qwen 2.5 3B Instruct39.5
11Qwen 1.5 14B Chat34.6
12Qwen 2 7B Instruct28.2
13Qwen 1.5 7B Chat23.6
14Qwen 2.5 1.5B Instruct22.6
15Qwen-14B-Chat20.5

Interactive version: theaggregate.ai/benchmark?slug=openeval-mmlu-pro-cot · How It Works · Data refreshed daily, snapshot 2026-09-05.