ERR-EVAL - Trick Questions: leaderboard

Metric: Track score. Source: err-eval.gustycube.com. 60 models tracked.

Top models

#ModelScore
1GPT-5.46.8
2GPT-5 Mini6.4
3Claude Opus 4.56.2
4Grok 4.20 Multi-Agent6.2
5Claude Sonnet 4.56
6GPT-5.36
7GPT-5.3 Codex6
8GPT-55.8
9Grok 45.8
10DeepSeek R15.8
11Kimi K2.55.8
12DeepSeek R1 05285.8
13Grok 4.205.8
14MiniMax-M2.15.8
15Gemini 3 Pro (Preview)5.6

Interactive version: theaggregate.ai/benchmark?slug=err-eval-trick-questions · How It Works · Data refreshed daily, snapshot 2026-09-19.