RewardBench Safety — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 330 models tracked.

Top models

#ModelScore
1Skywork-Reward-Gemma-2-27B-v0.296.89
2Gemini 2.5 Flash (Preview 04-17)90.94
3Gemini 2.5 Flash90.9
4ArmoRM-Llama3-8B-v0.190.54
5Claude 3.7 Sonnet (20250219)90.33
6Claude Opus 4 (20250514)89.54
7Claude Sonnet 4 (20250514)89.09
8GPT-4o (2024-08-06)88.11
9Gemini 2.5 Pro88.1
10Gemini 2.5 Pro (Preview 05-06)88.06
11Gemini 1.5 Pro (0514)87.91
12GPT-4 Turbo87.57
13GPT-4 Preview (0125)87.57
14GPT-4.187.26
15Gemini 1.5 Flash (001)86.96

Interactive version: theaggregate.ai/benchmark?slug=rewardbench-safety · How the rankings work · Data refreshed daily, snapshot 2026-07-22.