RewardBench 2 Ties: leaderboard

Metric: Score (%). Source: huggingface.co. Saturation forecast: Estimated already saturated. 197 models tracked.

Top models

#ModelScore
1Llama 3.1 70B Instruct RM RB288.35
2INF-ORM-Llama3.1-70B86.22
3GPT-4.185.42
4Claude Opus 4 (20250514)83.75
5Gemini 2.5 Flash (Preview 04-17)83.41
6QRM-Gemma-2-27B83.21
7Llama-3.1-Tulu-3-70B-SFT-RM-RB283.08
8Skywork-Reward-Gemma-2-27B-v0.281.82
9Gemini 2.5 Pro81.1
10Gemini 2.5 Flash80.9
11Claude Sonnet 4 (20250514)79.39
12GPT-4o (2024-08-06)78.19
13URM-LLaMa-3.1-8B76.53
14LDL-Reward-Gemma-2-27B-v0.176.33
15GPT-4.1 Mini74

Interactive version: theaggregate.ai/benchmark?slug=rewardbench-2-ties · How It Works · Data refreshed daily, snapshot 2026-09-28.