RewardBench Precise IF — leaderboard

Metric: Score (%). Source: huggingface.co. 197 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro61.9
2Gemini 2.5 Flash57.5
3Gemini 2.5 Flash (Preview 04-17)55.31
4Claude 3.7 Sonnet (20250219)54.37
5Gemini 2.5 Pro (Preview 05-06)46.88
6Claude Opus 4 (20250514)41.88
7ArmoRM-Llama3-8B-v0.141.88
8GPT-4.1 Mini41.25
9GPT-4.139.74
10Claude 3.5 Sonnet (20240620)38.75
11Skywork-Reward-Gemma-2-27B-v0.237.5
12Gemini 1.5 Flash-8B36.25
13Claude Sonnet 4 (20250514)35.94
14Llama-3.1-Tulu-3-8B-RM34.69
15GPT-4o Mini (2024-07-18)34.38

Interactive version: theaggregate.ai/benchmark?slug=rewardbench-precise-if · How the rankings work · Data refreshed daily, snapshot 2026-07-22.