ERR-EVAL - Impossible Asks: leaderboard

Metric: Track score. Source: err-eval.gustycube.com. 60 models tracked.

Top models

#ModelScore
1GPT-5.27
2Claude Sonnet 4.65.4
3Claude Opus 4.55.2
4GPT-5.34.8
5Claude Sonnet 4.54.4
6GPT-5.3 Codex4.4
7GPT-5.2 Pro4.4
8GPT-5.44.2
9Claude Haiku 4.54.2
10GPT-4.13.6
11Gemini 3 Pro (Preview)3.6
12Claude Sonnet 43.6
13GPT-5.13.6
14Qwen 3.5 Plus3.6
15Gemini 2.5 Pro (Preview)3.6

Interactive version: theaggregate.ai/benchmark?slug=err-eval-impossible-asks · How It Works · Data refreshed daily, snapshot 2026-09-19.