HELM VHELM - Core Scenarios: leaderboard

Metric: Mean win rate. Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)87.09
2O3 (2025-04-16)80.96
3O4 Mini (2025-04-16)76.01
4GPT-4.572.78
5Gemini 2.0 Pro (Preview 02-05)72.38
6O1 (2024-12-17)71.61
7GPT-4.1 (2025-04-14)69.52
8Gemini 2.0 Flash (Preview)68.09
9GPT-4.1 Mini65.59
10GPT-4o (2024-05-13)65.3
11Gemini 2.0 Flash64.56
12GPT-4o (2024-11-20)62.69
13GPT-4o (2024-08-06)59.79
14Gemini 2.0 Flash Lite59.72
15Gemini 1.5 Pro (002)59.61

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-core-scenarios · How It Works · Data refreshed daily, snapshot 2026-09-08.