RewardBench Factuality — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 197 models tracked.

Top models

#ModelScore
1GPT-4.182.89
2Claude Opus 4 (20250514)82.67
3Skywork-Reward-Gemma-2-27B-v0.276.74
4Claude Sonnet 4 (20250514)76.12
5Gemini 2.5 Pro75.5
6Llama-3.1-Tulu-3-8B-RM74.53
7Claude 3.7 Sonnet (20250219)73.26
8Gemini 2.5 Flash67.4
9Gemini 2.5 Flash (Preview 04-17)65.74
10ArmoRM-Llama3-8B-v0.165.68
11Gemini 2.5 Pro (Preview 05-06)65.32
12GPT-4.1 Mini60.84
13GPT-4o (2024-08-06)56.84
14Claude 3 Opus (20240229)53.89
15Claude 3.5 Sonnet (20240620)52.84

Interactive version: theaggregate.ai/benchmark?slug=rewardbench-factuality · How the rankings work · Data refreshed daily, snapshot 2026-07-22.