HELM VHELM - Blink Knowledge - Functional Correspondence: leaderboard

Metric: Prefix Quasi-Exact Match (%). Source: crfm.stanford.edu. 48 models tracked.

Top models

#ModelScore
1O3 (2025-04-16)70.77
2O4 Mini (2025-04-16)70
3O1 (2024-12-17)68.46
4Gemini 2.5 Pro (Preview 03-25)66.92
5Gemini 2.0 Flash65.38
6Gemini 2.0 Flash (Preview)61.54
7GPT-4.1 (2025-04-14)59.23
8GPT-4.1 Mini56.15
9Claude 3.5 Sonnet (20241022)56.15
10Gemini 2.0 Flash Lite56.15
11Gemini 1.5 Pro (002)55.38
12Llama 4 Maverick Instruct FP854.62
13Claude 3.5 Sonnet (20240620)53.08
14GPT-4o (2024-08-06)53.08
15GPT-4.553.08

Interactive version: theaggregate.ai/benchmark?slug=helm-vhelm-blink-knowledge-functional-correspondence · How It Works · Data refreshed daily, snapshot 2026-09-19.