HELM Robo-Reward-Bench - Cmu Play Fusion: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)0.63
2Gemini 3 Flash (Preview)0.71
3Gemini 2.5 Flash0.78
4Gemini 2.5 Pro0.8
5GPT-5.5 (xHigh)0.97
6GPT-50.99
7Gemini 2.5 Flash Lite1.07
8GPT-5 Mini (2025-08-07)1.14
9GPT-5.21.18
10Llama 4 Maverick Instruct1.28
11Llama 4 Scout Instruct1.37
12GPT-5 Nano1.51

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-cmu-play-fusion · How It Works · Data refreshed daily, snapshot 2026-09-08.