HELM VHELM - Mmmu - Psychology: leaderboard

Metric: Prefix Quasi-Exact Match (%). Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1GPT-4.582.76
2Claude 3.5 Sonnet (20241022)75.86
3Claude 3.5 Sonnet (20240620)75.86
4Gemini 2.5 Pro (Preview 03-25)75.86
5GPT-4o (2024-08-06)75.86
6GPT-4o (2024-05-13)75.86
7O4 Mini (2025-04-16)75.86
8O1 (2024-12-17)75.86
9GPT-4o (2024-11-20)75.86
10Gemini 1.5 Flash (002)72.41
11Gemini 2.0 Flash72.41
12O3 (2025-04-16)72.41
13Gemini 2.0 Pro (Preview 02-05)72.41
14GPT-4.1 Mini68.97
15Gemini 1.5 Pro (002)68.97

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-mmmu-psychology · How It Works · Data refreshed daily, snapshot 2026-09-19.