HELM VHELM - Blink Reasoning - Multi-view Reasoning: leaderboard

Metric: Prefix Quasi-Exact Match (%). Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20240620)100
2Llama 4 Maverick Instruct FP8100
3Claude 3 Opus (20240229)100
4Claude 3 Haiku (20240307)100
5Claude 3 Sonnet (20240229)100
6Gemini 2.0 Flash Lite100
7GPT-4.1 (2025-04-14)99.25
8GPT-4o Mini (2024-07-18)98.5
9GPT-4 Turbo96.99
10Llama 4 Scout Instruct95.49
11O1 (2024-12-17)92.48
12Gemini 2.5 Pro (Preview 03-25)83.46
13O3 (2025-04-16)68.42
14GPT-4o (2024-11-20)68.42
15O4 Mini (2025-04-16)67.67

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-blink-reasoning-multi-view-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.