HELM VHELM - Robustness: leaderboard

Metric: Mean win rate. Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)88.3
2Gemini 2.0 Pro (Preview 02-05)82.98
3O4 Mini (2025-04-16)81.91
4O3 (2025-04-16)79.26
5Gemini 2.0 Flash (Preview)72.87
6Gemini 1.5 Flash (002)68.62
7O1 (2024-12-17)68.09
8Gemini 2.0 Flash67.02
9GPT-4.564.89
10GPT-4.1 (2025-04-14)63.83
11Gemini 1.5 Pro (002)62.23
12GPT-4.1 Mini61.7
13GPT-4o Mini (2024-07-18)61.7
14Gemini 2.0 Flash Lite60.11
15GPT-4o (2024-11-20)59.57

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-robustness · How It Works · Data refreshed daily, snapshot 2026-09-08.