Agents' Last Exam (Claude Code): leaderboard

Metric: Overall Pass Rate (%). Source: snorkel.ai. Saturation forecast: Rough model projection: around 2026. 16 models tracked.

Top models

#ModelScore
1Claude Opus 5.5 (ALE Run: harness=Claude%20Code; effort=Max; source-model=Claude%20Opus%205.5)38.16
2Claude Opus 5 (ALE Run: harness=Claude%20Code; effort=High; source-model=Claude%20Opus%205)32.24
3Claude Opus 5 (ALE Run: harness=Claude%20Code; effort=Max; source-model=Claude%20Opus%205)30.92
4Claude Opus 5 (ALE Run: harness=Claude%20Code; effort=XHigh; source-model=Claude%20Opus%205)30.26
5Claude Opus 5 (ALE Run: harness=Claude%20Code; effort=Medium; source-model=Claude%20Opus%205)28.95
6Claude Opus 5 (ALE Run: harness=Claude%20Code; effort=Low; source-model=Claude%20Opus%205)27.63
7Qwen3.8-Max (ALE Run: harness=Claude%20Code; effort=XHigh; source-model=Qwen3%208-Max)26.97
8Kimi K3 (ALE Run: harness=Claude%20Code; effort=Max; source-model=Kimi%20K3)26.97
9Claude Opus 4.8 (ALE Run: harness=Claude%20Code; effort=Max; source-model=Claude%20Opus%204.8)26.97
10Claude Fable 5 (ALE Run: harness=Claude%20Code; effort=XHigh; source-model=Claude%20Fable%205)25.66

Interactive version: theaggregate.ai/benchmark?slug=agents-last-exam-claude-code · How It Works · Data refreshed daily, snapshot 2026-10-09.