HELM VHELM - Mm Star Reasoning - Math: leaderboard

Metric: Prefix Quasi-Exact Match (%). Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1O3 (2025-04-16)91.6
2O4 Mini (2025-04-16)89.2
3Gemini 2.5 Pro (Preview 03-25)87.6
4O1 (2024-12-17)87.2
5Gemini 2.0 Pro (Preview 02-05)86.4
6Gemini 2.0 Flash (Preview)83.6
7Gemini 1.5 Pro (002)81.2
8GPT-4.580.4
9Gemini 2.0 Flash78.8
10Gemini 2.0 Flash Lite76.4
11GPT-4o (2024-05-13)69.6
12GPT-4.1 (2025-04-14)69.2
13GPT-4o (2024-08-06)65.2
14Claude 3 Sonnet (20240229)58.4
15Gemini 1.5 Flash (002)58

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-mm-star-reasoning-math · How It Works · Data refreshed daily, snapshot 2026-09-19.