ERR-EVAL: leaderboard

Metric: Overall score. Source: err-eval.gustycube.com. 60 models tracked.

Top models

#ModelScore
1GPT-5.26.4
2Claude Sonnet 4.65.88
3Claude Opus 4.55.8
4GPT-5.2 Pro5.76
5GPT-5.45.6
6Claude Opus 4.65.48
7Claude Sonnet 4.55.28
8Claude Haiku 4.55.04
9GPT-5.3 Codex5
10GPT-5.4 Mini4.96
11GPT-5.14.84
12GPT-5.34.76
13Grok 44.68
14GPT-5 Mini4.68
15Claude Sonnet 44.64

Interactive version: theaggregate.ai/benchmark?slug=err-eval · How It Works · Data refreshed daily, snapshot 2026-09-19.