RewardBench Chat — leaderboard
Metric: Accuracy (%). Source: huggingface.co. 178 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Llama 3 70B Instruct | 97.63 |
| 2 | tulu-2-dpo-70B | 97.49 |
| 3 | tulu-2-dpo-7B | 97.49 |
| 4 | Llama 3.1 70B Instruct | 97.21 |
| 5 | Llama 3.1 405B Instruct | 97.21 |
| 6 | ArmoRM-Llama3-8B-v0.1 | 96.93 |
| 7 | GPT-4o (2024-05-13) | 96.65 |
| 8 | stablelm-2-12B-chat | 96.65 |
| 9 | stablelm-2-zephyr-1.6B | 96.65 |
| 10 | Claude 3.5 Sonnet (20240620) | 96.37 |
| 11 | Hermes 3 - Llama-3.1 70B | 96.23 |
| 12 | GPT-4o (2024-08-06) | 96.09 |
| 13 | Skywork-Reward-Gemma-2-27B-v0.2 | 96.09 |
| 14 | tulu-2-dpo-13B | 95.81 |
| 15 | zephyr-7B-gemma-v0.1 | 95.81 |
Interactive version: theaggregate.ai/benchmark?slug=rewardbench-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.