Proof of Time - 30-Message Budget: leaderboard

Metric: Sample-Weighted Accuracy (%), 30-message agent budget. Source: arxiv.org. Saturation forecast: Around 2031. 11 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro55.6
2Gemini 3 Pro (Preview)44.8
3GPT-5.144.3
4GPT-5.239.3
5GPT-5 Mini38.7
6Gemini 2.5 Flash37
7GPT-5 Nano35.1
8Gemini 3 Flash (Preview)32
9Claude Opus 4.528.2
10Claude Haiku 4.526.1
11Claude Sonnet 4.525.9

Interactive version: theaggregate.ai/benchmark?slug=proof-of-time-30-message-budget · How It Works · Data refreshed daily, snapshot 2026-09-25.