ExCyTIn-Bench: leaderboard

Metric: Total average reward over the 589 test questions (0-1, partial credit). Source: github.com. 28 models tracked.

Top models

#ModelScore
1Claude Opus 4.50.61
2GPT-5.1 (High)0.58
3GPT-5 (High)0.56
4GPT-5 (Medium)0.54
5GPT-5.1 (Medium)0.54
6Claude Sonnet 4.50.49
7O30.46
8GPT-5.1 (Low)0.45
9GPT-5 (Low)0.38
10GPT-5 Mini0.37
11O4 Mini0.37
12Grok 40.34
13GPT-4.10.34
14GPT-5.1 (Non-reasoning)0.32
15Gemini 2.5 Flash0.31

Interactive version: theaggregate.ai/benchmark?slug=excytin-bench · How It Works · Data refreshed daily, snapshot 2026-09-19.