HELM Robo-Reward-Bench - Austin Buds Dataset Converted Externally To Rlds: leaderboard

Metric: Absolute error. Source: crfm.stanford.edu. 20 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash0.84
2GPT-51.24
3GPT-5 Mini (2025-08-07)1.26
4Gemini 2.5 Pro1.27
5GPT-4.1 (2025-04-14)1.4
6Gemini 2.0 Flash Lite1.4
7O1 (2024-12-17)1.44
8GPT-4.1 Mini1.48
9Gemini 2.0 Flash1.5
10Gemini 2.5 Flash Lite1.59
11GPT-5 Nano1.69
12GPT-4o (2024-11-20)2.31

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-austin-buds-dataset-converted-externally-to-rlds · How It Works · Data refreshed daily, snapshot 2026-09-08.