HELM Robo-Reward-Bench - Core Scenarios: leaderboard

Metric: Mean Abs. Error (↓ better). Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)63.02
2GPT-5 Mini (2025-08-07)69.1
3GPT-581.07
4Gemini 3 Pro (Preview)85.08
5GPT-5.288.73
6Gemini 2.5 Pro90.16
7Gemini 3 Flash (Preview)91.7
8Gemini 2.5 Flash94.27
9Gemini 2.5 Flash Lite98.98
10Llama 4 Maverick Instruct127.06
11GPT-5 Nano129.51
12Llama 4 Scout Instruct148.5

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-core-scenarios · How It Works · Data refreshed daily, snapshot 2026-09-08.