HELM VHELM - Mm Star Reasoning: leaderboard

Metric: PEM. Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1O3 (2025-04-16)87.47
2Gemini 2.5 Pro (Preview 03-25)87.33
3O4 Mini (2025-04-16)87.07
4O1 (2024-12-17)84.27
5Gemini 2.0 Pro (Preview 02-05)80.8
6Gemini 2.0 Flash (Preview)80.27
7GPT-4.578.93
8Gemini 2.0 Flash78.53
9Gemini 2.0 Flash Lite (Preview 02-05)77.33
10Gemini 1.5 Pro (002)76.67
11Gemini 2.0 Flash Lite76.27
12GPT-4.1 (2025-04-14)74.4
13GPT-4o (2024-05-13)74
14GPT-4o (2024-08-06)72.13
15GPT-4.1 Mini69.07

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-mm-star-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-08.