HELM Robo-Reward-Bench - Nyu Door Opening Surprising Effectiveness: leaderboard

Metric: Absolute error. Source: crfm.stanford.edu. 20 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro0.74
2GPT-51.07
3GPT-4.1 (2025-04-14)1.09
4Gemini 2.0 Flash Lite1.12
5GPT-4.1 Mini1.2
6O1 (2024-12-17)1.2
7Gemini 2.5 Flash1.25
8GPT-5 Mini (2025-08-07)1.26
9Gemini 2.0 Flash1.34
10GPT-4o (2024-11-20)1.35
11Gemini 2.5 Flash Lite1.66
12GPT-5 Nano1.84

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-nyu-door-opening-surprising-effectiveness · How It Works · Data refreshed daily, snapshot 2026-09-08.