HELM Robo-Reward-Bench - Tokyo U Lsmo Converted Externally To Rlds: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash0.46
2Gemini 3 Flash (Preview)0.55
3GPT-50.65
4GPT-5 Mini (2025-08-07)0.68
5GPT-5.5 (xHigh)0.73
6Gemini 2.5 Pro0.92
7Gemini 3 Pro (Preview)0.97
8GPT-5.20.99
9Gemini 2.5 Flash Lite1.2
10GPT-5 Nano1.37
11Llama 4 Maverick Instruct1.61
12Llama 4 Scout Instruct1.75

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-tokyo-u-lsmo-converted-externally-to-rlds · How It Works · Data refreshed daily, snapshot 2026-09-08.