HELM VHELM - Mmmu - Diagnostics and Laboratory Medicine: leaderboard

Metric: Prefix Quasi-Exact Match (%). Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1GPT-4o (2024-05-13)60
2GPT-4.1 (2025-04-14)56.67
3GPT-4.1 Mini53.33
4Gemini 2.5 Pro (Preview 03-25)53.33
5GPT-4o (2024-08-06)53.33
6GPT-4.553.33
7GPT-4o (2024-11-20)53.33
8Claude 3.5 Sonnet (20241022)50
9GPT-4 Turbo50
10Llama 4 Maverick Instruct FP850
11O4 Mini (2025-04-16)50
12O3 (2025-04-16)50
13O1 (2024-12-17)50
14Gemini 2.0 Pro (Preview 02-05)46.67
15Claude 3.5 Sonnet (20240620)43.33

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-mmmu-diagnostics-and-laboratory-medicine · How It Works · Data refreshed daily, snapshot 2026-09-19.