HELM VHELM - Multilinguality: leaderboard

Metric: Mean win rate. Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)100
2O3 (2025-04-16)96.81
3GPT-4.596.81
4Gemini 2.0 Pro (Preview 02-05)92.02
5Gemini 2.0 Flash (Preview)88.83
6Gemini 2.0 Flash86.97
7GPT-4.1 (2025-04-14)86.17
8O4 Mini (2025-04-16)84.31
9GPT-4o (2024-11-20)83.78
10GPT-4o (2024-05-13)83.24
11GPT-4o (2024-08-06)80.32
12Gemini 1.5 Pro (002)73.94
13Gemini 2.0 Flash Lite (Preview 02-05)72.34
14Gemini 2.0 Flash Lite71.81
15GPT-4.1 Mini65.43

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-multilinguality · How It Works · Data refreshed daily, snapshot 2026-09-08.