Agents' Last Exam (Droid): leaderboard

Metric: Overall Pass Rate (%). Source: snorkel.ai. Saturation forecast: Rough model projection: around 2026. 2 models tracked.

Top models

#ModelScore
1GPT-5.5 (ALE Run: harness=Droid; effort=High; source-model=GPT-5.5)19.74
2Claude Opus 4.7 (ALE Run: harness=Droid; effort=High; source-model=Claude%20Opus%204.7)13.49

Interactive version: theaggregate.ai/benchmark?slug=agents-last-exam-droid · How It Works · Data refreshed daily, snapshot 2026-10-09.