RewardBench Prior Sets (0.5 weight) — leaderboard
Metric: Score (%). Source: huggingface.co. 105 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | ArmoRM-Llama3-8B-v0.1 | 74.29 |
| 2 | GPT-4 Turbo | 73.63 |
| 3 | GPT-4o (2024-05-13) | 72.62 |
| 4 | GPT-4 Preview (0125) | 70.85 |
| 5 | Llama 3 70B Instruct | 70.35 |
| 6 | Claude 3 Sonnet (20240229) | 69.63 |
| 7 | Gemini 1.5 Flash (001) | 69.37 |
| 8 | c4ai-command-r-plus | 69.24 |
| 9 | Claude 3 Haiku (20240307) | 66.35 |
| 10 | GPT-3.5 Turbo (0125) | 65.48 |
| 11 | Faro-Yi-9B-DPO | 63.95 |
| 12 | Llama 3 8B Instruct | 60.82 |
| 13 | Nous-Hermes-2-Mistral-7B-DPO | 55.5 |
| 14 | starchat2-15B-v0.1 | 55.25 |
| 15 | zephyr-7B-alpha | 53.53 |
Interactive version: theaggregate.ai/benchmark?slug=rewardbench-prior-sets-0-5-weight · How the rankings work · Data refreshed daily, snapshot 2026-07-22.