HELM Robo-Reward-Bench - Viola: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)0.1
2GPT-5.5 (xHigh)0.15
3Gemini 2.5 Pro0.17
4Gemini 2.5 Flash0.25
5GPT-50.28
6Gemini 3 Pro (Preview)0.28
7GPT-5.20.32
8GPT-5 Mini (2025-08-07)0.32
9Gemini 2.5 Flash Lite0.5
10GPT-5 Nano0.92
11Llama 4 Maverick Instruct2.13
12Llama 4 Scout Instruct2.55

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-viola · How It Works · Data refreshed daily, snapshot 2026-09-08.