o11y-bench - Pass@3: leaderboard

Metric: Tasks passed on at least one of three attempts, Pass@3 (%). Source: o11ybench.ai. 52 models tracked.

Top models

#ModelScore
1Claude Opus 5 (High)93.65
2Claude Opus 5 (Low)92.06
3GPT-5.6 Sol (High)90.48
4Claude Opus 4.7 (High)90.48
5Claude Opus 4.6 (Non-reasoning)90.48
6Claude Opus 4.8 (High)88.89
7GPT-5.6 Terra (High)87.3
8GPT-5.6 Luna (High)87.3
9Claude Opus 4.8 (Low)87.3
10GPT-5.6 Terra (Low)85.71
11GPT-5.4 (High)84.13
12Claude Sonnet 4.6 (High)84.13
13Gemini 3 Flash (Preview) (High)84.13
14Gemini 3 Flash (Preview) (Low)84.13
15Gemini 3 Flash (Preview) (Non-reasoning)82.54

Interactive version: theaggregate.ai/benchmark?slug=o11y-bench-pass-3 · How It Works · Data refreshed daily, snapshot 2026-09-19.