HELM VHELM - Blink Perception - Relative Reflectance: leaderboard

Metric: Prefix Quasi-Exact Match (%). Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1Claude 3 Sonnet (20240229)68.66
2Claude 3 Haiku (20240307)67.16
3Claude 3.5 Sonnet (20241022)65.67
4Llama 4 Scout Instruct65.67
5GPT-4o Mini (2024-07-18)64.93
6Llama 4 Maverick Instruct FP864.18
7GPT-4 Turbo63.43
8Claude 3 Opus (20240229)59.7
9GPT-4o (2024-11-20)59.7
10Gemini 2.0 Flash Lite58.96
11GPT-4o (2024-05-13)58.21
12O4 Mini (2025-04-16)58.21
13Claude 3.5 Sonnet (20240620)57.46
14Gemini 2.5 Pro (Preview 03-25)55.22
15GPT-4.555.22

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-blink-perception-relative-reflectance · How It Works · Data refreshed daily, snapshot 2026-09-19.