RewardBench Precise IF — leaderboard
Metric: Score (%). Source: huggingface.co. 197 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemini 2.5 Pro | 61.9 |
| 2 | Gemini 2.5 Flash | 57.5 |
| 3 | Gemini 2.5 Flash (Preview 04-17) | 55.31 |
| 4 | Claude 3.7 Sonnet (20250219) | 54.37 |
| 5 | Gemini 2.5 Pro (Preview 05-06) | 46.88 |
| 6 | Claude Opus 4 (20250514) | 41.88 |
| 7 | ArmoRM-Llama3-8B-v0.1 | 41.88 |
| 8 | GPT-4.1 Mini | 41.25 |
| 9 | GPT-4.1 | 39.74 |
| 10 | Claude 3.5 Sonnet (20240620) | 38.75 |
| 11 | Skywork-Reward-Gemma-2-27B-v0.2 | 37.5 |
| 12 | Gemini 1.5 Flash-8B | 36.25 |
| 13 | Claude Sonnet 4 (20250514) | 35.94 |
| 14 | Llama-3.1-Tulu-3-8B-RM | 34.69 |
| 15 | GPT-4o Mini (2024-07-18) | 34.38 |
Interactive version: theaggregate.ai/benchmark?slug=rewardbench-precise-if · How the rankings work · Data refreshed daily, snapshot 2026-07-22.