HELM VHELM - Fairness: leaderboard

Metric: Mean win rate. Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1GPT-4.595.21
2GPT-4o (2024-05-13)90.43
3Gemini 2.0 Flash (Preview)88.83
4O3 (2025-04-16)82.98
5GPT-4.1 (2025-04-14)81.38
6GPT-4.1 Mini79.79
7Gemini 2.5 Pro (Preview 03-25)76.6
8GPT-4o (2024-08-06)72.34
9Gemini 2.0 Flash Lite72.34
10GPT-4o (2024-11-20)68.62
11Gemini 1.5 Pro (002)68.09
12Gemini 2.0 Flash68.09
13Gemini 2.0 Flash Lite (Preview 02-05)65.96
14Gemini 1.5 Flash (002)64.36
15O4 Mini (2025-04-16)61.7

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-fairness · How It Works · Data refreshed daily, snapshot 2026-09-08.