RewardBench Chat Hard — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 178 models tracked.

Top models

#ModelScore
1Skywork-Reward-Gemma-2-27B-v0.289.91
2Gemini 1.5 Pro (0514)80.59
3Gemini 1.5 Pro (Sept)76.97
4ArmoRM-Llama3-8B-v0.176.75
5GPT-4o (2024-08-06)76.1
6GPT-4 Turbo75.44
7Llama 3.1 405B Instruct74.56
8GPT-4 Preview (0125)74.34
9Claude 3.5 Sonnet (20240620)74.01
10GPT-4o (2024-05-13)70.39
11Llama 3.1 70B Instruct70.18
12Qwen 1.5 14B Chat70.18
13Qwen 1.5 7B Chat69.08
14SOLAR-10.7B-Instruct-v1.068.64
15Qwen 1.5 72B Chat66.01

Interactive version: theaggregate.ai/benchmark?slug=rewardbench-chat-hard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.