RoboBench — leaderboard

Embodied-brain benchmark for multimodal LLMs across perception, instruction comprehension, planning, affordance prediction, and failure analysis.

Metric: Overall Dimension Average (self-reported). Source: benchmarklist.com. Status: saturation imminent. 15 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro50.1
2Gemini 2.5 Flash45.06
3Gemini 2.0 Flash45.04
4Claude 3.7 Sonnet40.53
5GPT-4o40.16
6Claude 3.5 Sonnet37.82
7GPT-4o Mini34.4

Interactive version: theaggregate.ai/benchmark?slug=robobench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.