HELM VHELM - Mm Star Reasoning - Instance Reasoning: leaderboard

Metric: Prefix Quasi-Exact Match (%). Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)86.4
2O4 Mini (2025-04-16)84.4
3O3 (2025-04-16)83.6
4O1 (2024-12-17)82
5Gemini 2.0 Flash (Preview)81.6
6Gemini 2.0 Pro (Preview 02-05)81.6
7Gemini 2.0 Flash80.8
8Llama 4 Maverick Instruct FP879.6
9GPT-4.578
10GPT-4.1 Mini77.2
11Claude 3.5 Sonnet (20240620)76.8
12GPT-4o (2024-05-13)76.8
13Gemini 1.5 Pro (002)76.4
14Gemini 1.5 Flash (002)76.4
15Gemini 2.0 Flash Lite76.4

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-mm-star-reasoning-instance-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.