METR Benchmark — leaderboard

Metric: 50% Time Horizon (hours). Source: metr.org. 26 models tracked.

Top models

#ModelScore
1Claude Mythos Preview17.41
2Claude Opus 4.611.98
3Gemini 3.1 Pro (Preview)6.4
4GPT-5.25.87
5GPT-5.3 Codex5.83
6GPT-5.45.7
7Claude Opus 4.54.88
8Gemini 3 Pro3.74
9GPT-5.1 Codex Max3.73
10GPT-53.38
11O32
12Claude Opus 41.67
13Claude Opus 4.11.67
14Claude 3.7 Sonnet1.01
15O10.65

Interactive version: theaggregate.ai/benchmark?slug=metr-benchmark · How the rankings work · Data refreshed daily, snapshot 2026-07-22.