RewardBench — leaderboard

Reward model benchmark evaluating preference models across chat, hard chat, safety, reasoning, and prior preference-evaluation sets.

Metric: Score (%). Source: huggingface.co. Status: saturation imminent. 330 models tracked.

Top models

#ModelScore
1Skywork-Reward-Gemma-2-27B-v0.294.26
2ArmoRM-Llama3-8B-v0.188.6
3Gemini 1.5 Pro (0514)88.2
4Gemini 1.5 Pro (Sept)86.78
5GPT-4o (2024-08-06)86.73
6GPT-4 Preview (0125)84.34
7Claude 3.5 Sonnet (20240620)84.17
8Llama 3.1 405B Instruct84.12
9Llama 3.1 70B Instruct84.05
10GPT-4 Turbo83.95
11GPT-4o (2024-05-13)83.27
12Gemma 2 27B (IT)80.9
13Gemini 1.5 Flash (001)80.54
14Claude 3 Opus (20240229)80.08
15GPT-4o Mini (2024-07-18)80.07

Interactive version: theaggregate.ai/benchmark?slug=rewardbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.