HELM VHELM - A Okvqa Robustness: leaderboard

Metric: EM (Robustness). Source: crfm.stanford.edu. 22 models tracked.

Top models

#ModelScore
1GPT-4o (2024-05-13)89.1
2GPT-4o (2024-08-06)87.8
3GPT-4o Mini (2024-07-18)85.1
4GPT-4 Turbo84.2
5Claude 3.5 Sonnet (20240620)83.5
6Claude 3 Haiku (20240307)73.8
7Claude 3 Opus (20240229)70.8
8Claude 3 Sonnet (20240229)70.8

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-a-okvqa-robustness · How It Works · Data refreshed daily, snapshot 2026-09-08.