Proof of Time: leaderboard

Metric: Sample-Weighted Accuracy (%), 50-message agent budget. Source: arxiv.org. Saturation forecast: Around 2028. 11 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)55.8
2Gemini 2.5 Pro53.6
3GPT-5.145
4Claude Opus 4.541.2
5GPT-5.240.1
6Gemini 3 Flash (Preview)39.2
7GPT-5 Mini37.7
8Gemini 2.5 Flash37.5
9Claude Haiku 4.535.1
10GPT-5 Nano33.9
11Claude Sonnet 4.531

Interactive version: theaggregate.ai/benchmark?slug=proof-of-time · How It Works · Data refreshed daily, snapshot 2026-09-25.