OpenEval - GPQA CoT: leaderboard

Metric: CoT Correctness (%). Source: huggingface.co. 23 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct45.07
2Qwen 3 4B Instruct39.69
3Qwen 2.5 32B Instruct38.79
4Qwen 2 72B Instruct37.89
5Qwen 2.5 14B Instruct36.1
6Qwen 2.5 7B Instruct Turbo34.08
7Qwen 2.5 3B Instruct32.74
8Qwen 1.5 32B Chat31.39
9Qwen 1.5 14B Chat30.72
10Qwen 2.5 7B Instruct28.48
11Qwen 2 7B Instruct27.8
12Qwen 2.5 1.5B Instruct26.68
13Qwen 1.5 7B Chat24.44
14Qwen-14B-Chat22.2
15Qwen 1.5 4B Chat20.85

Interactive version: theaggregate.ai/benchmark?slug=openeval-gpqa-cot · How It Works · Data refreshed daily, snapshot 2026-09-05.