ALE-Bench: leaderboard

Score-based algorithmic programming benchmark built from AtCoder Heuristic Contest tasks, evaluating AI systems on hard optimization problems with hidden/private test evaluation.

Metric: Performance (Self-Refine x1) (self-reported). Source: benchmarklist.com. Status: saturation imminent. 89 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)1942.97
2GPT-5.3 Codex (xHigh)1655.22
3GPT-5.4 (High)1607
4GPT-5.4 (Medium)1520.72
5Gemini 3 Flash (Preview) (High)1367.2
6Claude Sonnet 4.6 (Medium)1327.3
7Claude Opus 4.7 (Thinking)1323.05
8GPT-5.2 Codex (xHigh)1299.9
9GPT-5.2 (High)1293.55
10GPT-5.2 (Medium)1249.83
11GPT-5.1 Codex (High)1244.92
12GPT-5.1 (Thinking)1192.15
13GPT-5.4 Mini (High)1188.58
14Gemini 3 Pro (Preview) (High)1176.75
15GPT-5 (Thinking)1162.45

Interactive version: theaggregate.ai/benchmark?slug=ale-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.