Agents' Last Exam (Codex): leaderboard
Metric: Overall Pass Rate (%). Source: snorkel.ai. Saturation forecast: Rough model projection: around 2026. 36 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-6 Astra (ALE Run: harness=Codex; effort=Max; source-model=GPT-6%20Astra) | 34.21 |
| 2 | GPT-6 Astra (ALE Run: harness=Codex; effort=XHigh; source-model=GPT-6%20Astra) | 32.24 |
| 3 | GPT-6 Astra (ALE Run: harness=Codex; effort=Medium; source-model=GPT-6%20Astra) | 32.24 |
| 4 | GPT-6 Sol (ALE Run: harness=Codex; effort=XHigh; source-model=GPT-6%20Sol) | 32.24 |
| 5 | Muse Spark 1.3 (ALE Run: harness=Codex; effort=XHigh; source-model=Muse%20Spark%201.3) | 32.24 |
| 6 | GPT-6 Astra (ALE Run: harness=Codex; effort=High; source-model=GPT-6%20Astra) | 31.58 |
| 7 | GPT-6 Sol (ALE Run: harness=Codex; effort=Max; source-model=GPT-6%20Sol) | 31.58 |
| 8 | GPT-6 Sol (ALE Run: harness=Codex; effort=High; source-model=GPT-6%20Sol) | 31.58 |
| 9 | GPT-5.6 Sol (ALE Run: harness=Codex; effort=XHigh; source-model=GPT-5.6%20Sol) | 30.59 |
| 10 | GPT-5.6 Sol (ALE Run: harness=Codex; effort=High; source-model=GPT-5.6%20Sol) | 30.59 |
Interactive version: theaggregate.ai/benchmark?slug=agents-last-exam-codex · How It Works · Data refreshed daily, snapshot 2026-10-09.