HELM Robo-Reward-Bench - Jaco Play: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)0.64
2GPT-50.83
3Gemini 2.5 Pro0.89
4Gemini 3 Pro (Preview)0.89
5GPT-5.20.91
6Gemini 2.5 Flash Lite0.96
7Gemini 2.5 Flash0.99
8GPT-5 Mini (2025-08-07)1.09
9Gemini 3 Flash (Preview)1.1
10Llama 4 Maverick Instruct1.25
11GPT-5 Nano1.44
12Llama 4 Scout Instruct1.48

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-jaco-play · How It Works · Data refreshed daily, snapshot 2026-09-08.