OpenEval - GPQA CoT — leaderboard

Metric: CoT Correctness (%). Source: huggingface.co. 43 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct45.07
2Gemma 3 27B (IT)40.36
3Qwen 3 4B Instruct39.69
4Qwen 2.5 32B Instruct38.79
5Qwen 2 72B Instruct37.89
6Gemma 3 12B (IT)36.55
7Qwen 2.5 14B Instruct36.1
8Qwen 2.5 3B Instruct32.74
9Qwen 1.5 32B Chat31.39
10Gemma 2 27B (IT)30.72
11Qwen 1.5 14B Chat30.72
12Gemma 1.1 7B (IT)28.7
13Qwen 2.5 7B Instruct28.48
14Qwen 2 7B Instruct27.8
15gemma-7B (IT)27.58

Interactive version: theaggregate.ai/benchmark?slug=openeval-gpqa-cot · How the rankings work · Data refreshed daily, snapshot 2026-07-22.