RewardBench Math — leaderboard

Metric: Score (%). Source: huggingface.co. 197 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro89.8
2Gemini 2.5 Flash85.2
3Gemini 2.5 Flash (Preview 04-17)81.15
4Claude 3.7 Sonnet (20250219)75
5Claude Opus 4 (20250514)74.91
6GPT-4.1 Mini72.13
7Claude Sonnet 4 (20250514)70.49
8Skywork-Reward-Gemma-2-27B-v0.267.21
9ArmoRM-Llama3-8B-v0.166.12
10GPT-4.165.21
11Llama-3.1-Tulu-3-8B-RM64.48
12GPT-4o (2024-08-06)62.3
13Claude 3.5 Sonnet (20240620)56.83
14Gemini 2.5 Pro (Preview 05-06)53.42
15GPT-4o Mini (2024-07-18)51.91

Interactive version: theaggregate.ai/benchmark?slug=rewardbench-math · How the rankings work · Data refreshed daily, snapshot 2026-07-22.