HELM Robo-Reward-Bench - Berkeley Autolab Ur5: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)0.55
2GPT-5.5 (xHigh)0.6
3GPT-5 Mini (2025-08-07)0.64
4Gemini 3 Pro (Preview)0.69
5GPT-5.20.78
6GPT-50.83
7Gemini 2.5 Flash0.85
8Gemini 2.5 Pro0.92
9GPT-5 Nano1
10Llama 4 Scout Instruct1.01
11Gemini 2.5 Flash Lite1.11
12Llama 4 Maverick Instruct1.26

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-berkeley-autolab-ur5 · How It Works · Data refreshed daily, snapshot 2026-09-08.