Agents' Last Exam (Codex): leaderboard

Metric: Overall Pass Rate (%). Source: snorkel.ai. Saturation forecast: Rough model projection: around 2026. 36 models tracked.

Top models

#ModelScore
1GPT-6 Astra (ALE Run: harness=Codex; effort=Max; source-model=GPT-6%20Astra)34.21
2GPT-6 Astra (ALE Run: harness=Codex; effort=XHigh; source-model=GPT-6%20Astra)32.24
3GPT-6 Astra (ALE Run: harness=Codex; effort=Medium; source-model=GPT-6%20Astra)32.24
4GPT-6 Sol (ALE Run: harness=Codex; effort=XHigh; source-model=GPT-6%20Sol)32.24
5Muse Spark 1.3 (ALE Run: harness=Codex; effort=XHigh; source-model=Muse%20Spark%201.3)32.24
6GPT-6 Astra (ALE Run: harness=Codex; effort=High; source-model=GPT-6%20Astra)31.58
7GPT-6 Sol (ALE Run: harness=Codex; effort=Max; source-model=GPT-6%20Sol)31.58
8GPT-6 Sol (ALE Run: harness=Codex; effort=High; source-model=GPT-6%20Sol)31.58
9GPT-5.6 Sol (ALE Run: harness=Codex; effort=XHigh; source-model=GPT-5.6%20Sol)30.59
10GPT-5.6 Sol (ALE Run: harness=Codex; effort=High; source-model=GPT-5.6%20Sol)30.59

Interactive version: theaggregate.ai/benchmark?slug=agents-last-exam-codex · How It Works · Data refreshed daily, snapshot 2026-10-09.