HELM Robo-Reward-Bench - Roboturk: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1GPT-5 Mini (2025-08-07)0.51
2GPT-5.20.56
3GPT-5.5 (xHigh)0.59
4GPT-50.63
5GPT-5 Nano0.81
6Gemini 2.5 Flash0.98
7Gemini 3 Pro (Preview)0.99
8Llama 4 Maverick Instruct0.99
9Gemini 2.5 Flash Lite1.02
10Gemini 3 Flash (Preview)1.13
11Gemini 2.5 Pro1.31
12Llama 4 Scout Instruct1.35

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-roboturk · How It Works · Data refreshed daily, snapshot 2026-09-08.