RewardBench Reasoning — leaderboard
Metric: Accuracy (%). Source: huggingface.co. 171 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Skywork-Reward-Gemma-2-27B-v0.2 | 98.07 |
| 2 | ArmoRM-Llama3-8B-v0.1 | 97.35 |
| 3 | Gemini 1.5 Pro (0514) | 91.99 |
| 4 | Qwen 1.5 7B Chat | 90.41 |
| 5 | Gemini 1.5 Pro (Sept) | 90.22 |
| 6 | Qwen 1.5 14B Chat | 89.61 |
| 7 | stablelm-2-12B-chat | 89.45 |
| 8 | bagel-dpo-34B-v0.5 | 88.89 |
| 9 | Llama 3.1 405B Instruct | 87.15 |
| 10 | GPT-4 Preview (0125) | 86.92 |
| 11 | GPT-4o (2024-08-06) | 86.61 |
| 12 | Llama 3.1 70B Instruct | 85.99 |
| 13 | Qwen 1.5 72B Chat | 85.54 |
| 14 | Gemini 1.5 Flash (001) | 85.12 |
| 15 | GPT-4o (2024-05-13) | 84.87 |
Interactive version: theaggregate.ai/benchmark?slug=rewardbench-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.