HELM Robo-Reward-Bench - Droid Perspective: leaderboard

Metric: Absolute error. Source: crfm.stanford.edu. 20 models tracked.

Top models

#ModelScore
1GPT-5 Mini (2025-08-07)0.39
2GPT-4.1 Mini0.83
3Gemini 2.5 Flash0.89
4Gemini 2.0 Flash0.94
5Gemini 2.0 Flash Lite1.33
6Gemini 2.5 Pro1.5
7O1 (2024-12-17)1.56
8GPT-51.61
9GPT-4.1 (2025-04-14)1.61
10Gemini 2.5 Flash Lite1.61
11GPT-4o (2024-11-20)1.72
12GPT-5 Nano2.44

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-droid-perspective · How It Works · Data refreshed daily, snapshot 2026-09-08.