HELM VHELM - Mmmu - Literature: leaderboard

Metric: Prefix Quasi-Exact Match (%). Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1Gemini 1.5 Pro (002)90
2GPT-4.1 Mini86.67
3Claude 3.5 Sonnet (20241022)86.67
4GPT-4.1 Nano86.67
5Gemini 1.5 Flash (002)86.67
6Claude 3.5 Sonnet (20240620)86.67
7Gemini 2.0 Flash86.67
8GPT-4o Mini (2024-07-18)86.67
9GPT-4.1 (2025-04-14)86.67
10Gemini 2.5 Pro (Preview 03-25)86.67
11GPT-4o (2024-05-13)86.67
12GPT-4 Turbo86.67
13O4 Mini (2025-04-16)86.67
14Gemini 2.0 Flash (Preview)86.67
15O3 (2025-04-16)86.67

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-mmmu-literature · How It Works · Data refreshed daily, snapshot 2026-09-19.