Agents' Last Exam (Claude Code): leaderboard
Metric: Overall Pass Rate (%). Source: snorkel.ai. Saturation forecast: Rough model projection: around 2026. 16 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Claude Opus 5.5 (ALE Run: harness=Claude%20Code; effort=Max; source-model=Claude%20Opus%205.5) | 38.16 |
| 2 | Claude Opus 5 (ALE Run: harness=Claude%20Code; effort=High; source-model=Claude%20Opus%205) | 32.24 |
| 3 | Claude Opus 5 (ALE Run: harness=Claude%20Code; effort=Max; source-model=Claude%20Opus%205) | 30.92 |
| 4 | Claude Opus 5 (ALE Run: harness=Claude%20Code; effort=XHigh; source-model=Claude%20Opus%205) | 30.26 |
| 5 | Claude Opus 5 (ALE Run: harness=Claude%20Code; effort=Medium; source-model=Claude%20Opus%205) | 28.95 |
| 6 | Claude Opus 5 (ALE Run: harness=Claude%20Code; effort=Low; source-model=Claude%20Opus%205) | 27.63 |
| 7 | Qwen3.8-Max (ALE Run: harness=Claude%20Code; effort=XHigh; source-model=Qwen3%208-Max) | 26.97 |
| 8 | Kimi K3 (ALE Run: harness=Claude%20Code; effort=Max; source-model=Kimi%20K3) | 26.97 |
| 9 | Claude Opus 4.8 (ALE Run: harness=Claude%20Code; effort=Max; source-model=Claude%20Opus%204.8) | 26.97 |
| 10 | Claude Fable 5 (ALE Run: harness=Claude%20Code; effort=XHigh; source-model=Claude%20Fable%205) | 25.66 |
Interactive version: theaggregate.ai/benchmark?slug=agents-last-exam-claude-code · How It Works · Data refreshed daily, snapshot 2026-10-09.