RewardBench Reasoning — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 171 models tracked.

Top models

#ModelScore
1Skywork-Reward-Gemma-2-27B-v0.298.07
2ArmoRM-Llama3-8B-v0.197.35
3Gemini 1.5 Pro (0514)91.99
4Qwen 1.5 7B Chat90.41
5Gemini 1.5 Pro (Sept)90.22
6Qwen 1.5 14B Chat89.61
7stablelm-2-12B-chat89.45
8bagel-dpo-34B-v0.588.89
9Llama 3.1 405B Instruct87.15
10GPT-4 Preview (0125)86.92
11GPT-4o (2024-08-06)86.61
12Llama 3.1 70B Instruct85.99
13Qwen 1.5 72B Chat85.54
14Gemini 1.5 Flash (001)85.12
15GPT-4o (2024-05-13)84.87

Interactive version: theaggregate.ai/benchmark?slug=rewardbench-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.