HELM Robo-Reward-Bench - Berkeley Fanuc Manipulation: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro0.74
2Gemini 3 Flash (Preview)0.74
3GPT-5 Mini (2025-08-07)0.77
4GPT-5.5 (xHigh)0.78
5Gemini 2.5 Flash0.79
6Gemini 3 Pro (Preview)0.82
7GPT-50.93
8Llama 4 Maverick Instruct1
9Gemini 2.5 Flash Lite1.15
10GPT-5.21.16
11GPT-5 Nano1.32
12Llama 4 Scout Instruct1.51

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-berkeley-fanuc-manipulation · How It Works · Data refreshed daily, snapshot 2026-09-08.