HELM VHELM - Real World Reasoning: leaderboard

Metric: Mean win rate. Source: crfm.stanford.edu. 22 models tracked.

Top models

#ModelScore
1GPT-4o (2024-05-13)86.9
2GPT-4o (2024-08-06)79.76
3Claude 3.5 Sonnet (20240620)75
4GPT-4o Mini (2024-07-18)72.62
5GPT-4 Turbo67.86
6Claude 3 Haiku (20240307)42.86
7Claude 3 Sonnet (20240229)42.86
8Claude 3 Opus (20240229)40.48

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-real-world-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-08.