HELM Robo-Reward-Bench - Taco Play: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)0.92
2Gemini 3 Pro (Preview)0.99
3GPT-5 Mini (2025-08-07)1.08
4Gemini 3 Flash (Preview)1.09
5Llama 4 Maverick Instruct1.1
6GPT-51.11
7Gemini 2.5 Pro1.19
8Gemini 2.5 Flash Lite1.2
9GPT-5.21.31
10Gemini 2.5 Flash1.34
11Llama 4 Scout Instruct1.42
12GPT-5 Nano1.66

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-taco-play · How It Works · Data refreshed daily, snapshot 2026-09-08.