RewardBench Factuality — leaderboard
Metric: Accuracy (%). Source: huggingface.co. 197 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-4.1 | 82.89 |
| 2 | Claude Opus 4 (20250514) | 82.67 |
| 3 | Skywork-Reward-Gemma-2-27B-v0.2 | 76.74 |
| 4 | Claude Sonnet 4 (20250514) | 76.12 |
| 5 | Gemini 2.5 Pro | 75.5 |
| 6 | Llama-3.1-Tulu-3-8B-RM | 74.53 |
| 7 | Claude 3.7 Sonnet (20250219) | 73.26 |
| 8 | Gemini 2.5 Flash | 67.4 |
| 9 | Gemini 2.5 Flash (Preview 04-17) | 65.74 |
| 10 | ArmoRM-Llama3-8B-v0.1 | 65.68 |
| 11 | Gemini 2.5 Pro (Preview 05-06) | 65.32 |
| 12 | GPT-4.1 Mini | 60.84 |
| 13 | GPT-4o (2024-08-06) | 56.84 |
| 14 | Claude 3 Opus (20240229) | 53.89 |
| 15 | Claude 3.5 Sonnet (20240620) | 52.84 |
Interactive version: theaggregate.ai/benchmark?slug=rewardbench-factuality · How the rankings work · Data refreshed daily, snapshot 2026-07-22.