HELM Robo-Reward-Bench - Bridge: leaderboard

Metric: Absolute Error. Source: crfm.stanford.edu. 25 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)0.45
2GPT-5 Mini (2025-08-07)0.53
3Gemini 3 Pro (Preview)0.75
4GPT-50.79
5GPT-5.20.94
6Gemini 3 Flash (Preview)0.99
7Gemini 2.5 Flash Lite1.07
8Gemini 2.5 Flash1.08
9Llama 4 Maverick Instruct1.13
10Gemini 2.5 Pro1.17
11GPT-5 Nano1.31
12Llama 4 Scout Instruct1.44

Interactive version: theaggregate.ai/benchmark?slug=helm-robo-reward-bench-bridge · How It Works · Data refreshed daily, snapshot 2026-09-08.