ERR-EVAL - Unclear Wording: leaderboard

Metric: Track score. Source: err-eval.gustycube.com. 60 models tracked.

Top models

#ModelScore
1GPT-5.2 Pro7.4
2GPT-5.27
3GPT-5.47
4Claude Opus 4.56.8
5Claude Sonnet 4.66.6
6Grok 46.4
7Claude Opus 4.66.4
8GPT-5.3 Codex6.2
9Claude Sonnet 4.56
10GPT-5.4 Mini6
11O36
12GPT-5.36
13Claude Opus 45.8
14Grok 4.20 Multi-Agent5.8
15Kimi K2.55.6

Interactive version: theaggregate.ai/benchmark?slug=err-eval-unclear-wording · How It Works · Data refreshed daily, snapshot 2026-09-19.