HELM Lite — leaderboard

HELM Lite: Evaluates broad language-model knowledge, reasoning, commonsense, instruction following, or exam-style accuracy.

Metric: Mean win rate (self-reported). Source: benchmarklist.com. Status: saturated. 78 models tracked.

Top models

#ModelScore
1GPT-4o95.95
2Claude 3.5 Sonnet91.22
3GPT-490.89
4GPT-4 Turbo89.84
5Llama 3.1 405B Instruct88.91
6Llama 3.2 90B Vision Instruct85.96
7Palmyra-X-00485.05
8Llama 3.1 70B Instruct84.8
9Llama 3 70B82.65
10Qwen 2 72B Instruct81.53
11Mistral Large 2 (Nov) Instruct (2411)78.77
12Gemini 1.5 Pro78.18
13Qwen 2.5 72B Instruct78.06
14GPT-4o Mini75.68
15Mixtral 8x22B75.21

Interactive version: theaggregate.ai/benchmark?slug=helm-lite · How the rankings work · Data refreshed daily, snapshot 2026-07-22.