HELM Robo-Reward-Bench - Ucsd Kitchen Dataset Converted Externally To Rlds: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)0.78
2GPT-5 Mini (2025-08-07)0.83
3GPT-51.06
4GPT-5.21.11
5GPT-5 Nano1.23
6Gemini 3 Pro (Preview)1.24
7Gemini 2.5 Pro1.32
8Gemini 2.5 Flash Lite1.32
9Llama 4 Maverick Instruct1.36
10Gemini 2.5 Flash1.52
11Llama 4 Scout Instruct1.57
12Gemini 3 Flash (Preview)1.72

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-ucsd-kitchen-dataset-converted-externally-to-rlds · How It Works · Data refreshed daily, snapshot 2026-09-08.