HELM VHELM - Mmmu - Math: leaderboard

Metric: Prefix Quasi-Exact Match (%). Source: crfm.stanford.edu. 45 models tracked.

Top models

#ModelScore
1O3 (2025-04-16)82.76
2O4 Mini (2025-04-16)75.86
3O1 (2024-12-17)75.86
4Gemini 2.5 Pro (Preview 03-25)62.07
5Gemini 2.0 Pro (Preview 02-05)62.07
6Gemini 1.5 Pro (002)58.62
7GPT-4o (2024-08-06)55.17
8Gemini 1.5 Flash (002)48.28
9Claude 3.5 Sonnet (20240620)48.28
10Gemini 2.0 Flash48.28
11Llama 4 Maverick Instruct FP848.28
12Gemini 2.0 Flash (Preview)48.28
13GPT-4.1 Mini44.83
14Claude 3.5 Sonnet (20241022)44.83
15GPT-4.1 (2025-04-14)44.83

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-mmmu-math · How It Works · Data refreshed daily, snapshot 2026-09-19.