HELM VHELM - Mm Star Reasoning - Logical Reasoning: leaderboard

Metric: Prefix Quasi-Exact Match (%). Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 03-25)88
2O4 Mini (2025-04-16)87.6
3O3 (2025-04-16)87.2
4O1 (2024-12-17)83.6
5GPT-4.578.4
6GPT-4.1 (2025-04-14)78
7Gemini 2.0 Flash76
8GPT-4o (2024-08-06)76
9Gemini 2.0 Flash Lite76
10GPT-4o (2024-05-13)75.6
11Gemini 2.0 Flash (Preview)75.6
12Gemini 2.0 Pro (Preview 02-05)74.4
13GPT-4.1 Mini73.2
14GPT-4o (2024-11-20)72.8
15Gemini 1.5 Pro (002)72.4

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-mm-star-reasoning-logical-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.