RoboRMBench - Lexical Substitution Mean Error: leaderboard

Metric: Mean Error. Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1Gemma 3 27B1.37
2GPT-4o1.2
3Llama 4 Scout1.18
4Llama 4 Maverick1.11
5Claude Haiku 4.51.1
6Gemma 3 12B1.08
7GPT-5.11.04
8Gemini 2.5 Flash1.01
9Claude Sonnet 4.61
10Qwen 3 VL 8B0.89
11Gemini 3 Flash0.68

Interactive version: theaggregate.ai/benchmark?slug=robormbench-lexical-substitution-mean-error · How It Works · Data refreshed daily, snapshot 2026-09-21.