HELM Robo-Reward-Bench - Kaist Nonprehensile Converted Externally To Rlds: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1GPT-5 Mini (2025-08-07)0.77
2GPT-5.5 (xHigh)0.77
3Gemini 2.5 Flash Lite0.85
4Llama 4 Maverick Instruct0.85
5GPT-50.87
6GPT-5 Nano1
7GPT-5.21.06
8Gemini 2.5 Pro1.11
9Llama 4 Scout Instruct1.34
10Gemini 2.5 Flash1.36
11Gemini 3 Pro (Preview)1.49
12Gemini 3 Flash (Preview)1.51

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-kaist-nonprehensile-converted-externally-to-rlds · How It Works · Data refreshed daily, snapshot 2026-09-08.