METR Benchmark (80% Horizon) — leaderboard

Metric: 80% Time Horizon (hours). Source: metr.org. 26 models tracked.

Top models

#ModelScore
1Claude Mythos Preview3.1
2Gemini 3.1 Pro (Preview)1.5
3Claude Opus 4.61.16
4GPT-5.21.1
5GPT-5.3 Codex0.91
6GPT-5.40.9
7Gemini 3 Pro0.9
8GPT-5.1 Codex Max0.84
9Claude Opus 4.50.82
10GPT-50.64
11O30.5
12Claude Opus 4.10.39
13Claude Opus 40.34
14Claude 3.7 Sonnet0.2
15O10.12

Interactive version: theaggregate.ai/benchmark?slug=metr-benchmark-80-horizon · How the rankings work · Data refreshed daily, snapshot 2026-07-22.