HELMET (128K) — leaderboard

Metric: Average Score. Source: princeton-nlp.github.io. 64 models tracked.

Top models

#ModelScore
1GPT-4o (2024-08-06)64.8
2Gemini 1.5 Pro64.4
3GPT-4o Mini55.7
4Gemini 1.5 Flash52.1
5Llama 3.1 70B Instruct49.7
6Llama 3.3 70B Instruct48.2
7Jamba 1.5 Mini46.9
8Llama 3.1 8B Instruct46.5
9MiniCPM-SALA45.4
10Gemma 3 27B44.5
11Gemma 3 27B (IT)41.9
12Llama 3.1 70B41.7
13Jamba-v0.141.5
14Gemma 3 12B40.6
15Yi-34B-200K40.3

Interactive version: theaggregate.ai/benchmark?slug=helmet-128k · How the rankings work · Data refreshed daily, snapshot 2026-07-22.