HELM Robo-Reward-Bench - Utaustin Mutex: leaderboard

Metric: Absolute error. Source: crfm.stanford.edu. 20 models tracked.

Top models

#ModelScore
1Gemini 2.0 Flash1.02
2Gemini 2.5 Pro1.06
3O1 (2024-12-17)1.13
4GPT-5 Mini (2025-08-07)1.16
5Gemini 2.5 Flash1.3
6GPT-4.1 Mini1.33
7GPT-4o (2024-11-20)1.41
8Gemini 2.0 Flash Lite1.46
9GPT-51.5
10GPT-5 Nano1.55
11GPT-4.1 (2025-04-14)1.69
12Gemini 2.5 Flash Lite1.9

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-utaustin-mutex · How It Works · Data refreshed daily, snapshot 2026-09-08.