HELM Robo-Reward-Bench - Utokyo Pr2 Tabletop Manipulation Converted Externally To Rlds: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1GPT-5 Mini (2025-08-07)0.41
2Gemini 3 Pro (Preview)0.44
3Gemini 2.5 Pro0.47
4Gemini 2.5 Flash0.67
5Llama 4 Maverick Instruct0.7
6Gemini 3 Flash (Preview)0.77
7GPT-5.20.82
8Gemini 2.5 Flash Lite0.86
9GPT-5.5 (xHigh)0.9
10GPT-50.92
11Llama 4 Scout Instruct1.12
12GPT-5 Nano1.41

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-utokyo-pr2-tabletop-manipulation-converted-externally-to-rlds · How It Works · Data refreshed daily, snapshot 2026-09-08.