HELM Robo-Reward-Bench - Toto: leaderboard

Metric: Absolute error. Source: crfm.stanford.edu. 20 models tracked.

Top models

#ModelScore
1Gemini 2.0 Flash0.68
2Gemini 2.5 Flash0.69
3Gemini 2.0 Flash Lite0.76
4GPT-5 Mini (2025-08-07)0.76
5GPT-50.84
6Gemini 2.5 Pro1.04
7GPT-4o (2024-11-20)1.14
8O1 (2024-12-17)1.21
9GPT-4.1 (2025-04-14)1.31
10Gemini 2.5 Flash Lite1.47
11GPT-5 Nano1.57
12GPT-4.1 Mini1.83

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-toto · How It Works · Data refreshed daily, snapshot 2026-09-08.