RewardBench Chat — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 178 models tracked.

Top models

#ModelScore
1Llama 3 70B Instruct97.63
2tulu-2-dpo-70B97.49
3tulu-2-dpo-7B97.49
4Llama 3.1 70B Instruct97.21
5Llama 3.1 405B Instruct97.21
6ArmoRM-Llama3-8B-v0.196.93
7GPT-4o (2024-05-13)96.65
8stablelm-2-12B-chat96.65
9stablelm-2-zephyr-1.6B96.65
10Claude 3.5 Sonnet (20240620)96.37
11Hermes 3 - Llama-3.1 70B96.23
12GPT-4o (2024-08-06)96.09
13Skywork-Reward-Gemma-2-27B-v0.296.09
14tulu-2-dpo-13B95.81
15zephyr-7B-gemma-v0.195.81

Interactive version: theaggregate.ai/benchmark?slug=rewardbench-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.