HELM VHELM - Reasoning: leaderboard

Metric: Mean win rate. Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1O3 (2025-04-16)94.09
2Gemini 2.5 Pro (Preview 03-25)92.67
3O4 Mini (2025-04-16)87.71
4O1 (2024-12-17)86.52
5GPT-4.576.12
6Gemini 2.0 Flash (Preview)72.81
7GPT-4.1 (2025-04-14)72.81
8Gemini 2.0 Pro (Preview 02-05)71.63
9GPT-4.1 Mini68.32
10Gemini 2.0 Flash65.96
11Gemini 2.0 Flash Lite (Preview 02-05)65.96
12GPT-4o (2024-05-13)63.95
13Gemini 2.0 Flash Lite62.41
14Gemini 1.5 Pro (002)60.28
15GPT-4o (2024-11-20)60.05

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-08.