o11y-bench - Pass^3: leaderboard

Metric: Tasks passed on all three attempts, Pass^3 (%). Source: o11ybench.ai. 52 models tracked.

Top models

#ModelScore
1Claude Opus 4.8 (High)79.37
2Claude Opus 5 (High)76.19
3Claude Opus 4.7 (High)73.02
4Claude Sonnet 4.6 (High)68.25
5Claude Opus 5 (Low)68.25
6GPT-5.6 Sol (High)66.67
7GPT-5.6 Luna (High)66.67
8Claude Opus 4.6 (Non-reasoning)66.67
9GPT-5.6 Terra (High)65.08
10Gemini 3.1 Pro (Preview) (High)63.49
11GPT-5.4 (High)61.9
12Gemini 3 Flash (Preview) (High)61.9
13GPT-5.6 Terra (Low)60.32
14Claude Opus 4.8 (Low)60.32
15Gemini 3 Flash (Preview) (Non-reasoning)58.73

Interactive version: theaggregate.ai/benchmark?slug=o11y-bench-pass-pow-3 · How It Works · Data refreshed daily, snapshot 2026-09-19.