HELM Robo-Reward-Bench - Nyu Rot Dataset Converted Externally To Rlds: leaderboard

Metric: Absolute error. Source: crfm.stanford.edu. 20 models tracked.

Top models

#ModelScore
1GPT-51.13
2O1 (2024-12-17)1.13
3Gemini 2.5 Flash1.31
4Gemini 2.0 Flash Lite1.34
5GPT-4o (2024-11-20)1.36
6Gemini 2.5 Pro1.37
7GPT-5 Nano1.43
8GPT-4.1 (2025-04-14)1.49
9Gemini 2.0 Flash1.53
10GPT-5 Mini (2025-08-07)1.6
11Gemini 2.5 Flash Lite1.64
12GPT-4.1 Mini1.7

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-nyu-rot-dataset-converted-externally-to-rlds · How It Works · Data refreshed daily, snapshot 2026-09-08.