HELM Robo-Reward-Bench - Fractal20220817 Data: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)0.59
2GPT-5 Mini (2025-08-07)0.63
3GPT-50.83
4GPT-5.20.94
5Llama 4 Maverick Instruct1.02
6Gemini 3 Pro (Preview)1.04
7Gemini 2.5 Flash Lite1.13
8Gemini 3 Flash (Preview)1.13
9Gemini 2.5 Pro1.2
10GPT-5 Nano1.35
11Gemini 2.5 Flash1.43
12Llama 4 Scout Instruct1.5

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-fractal20220817-data · How It Works · Data refreshed daily, snapshot 2026-09-08.