FORTE - Pass^3: leaderboard

Metric: Pass^3 (%, task solved in all three runs). Source: agi-eval-official.github.io. 21 models tracked.

Top models

#ModelScore
1Claude Opus 4.869.95
2GPT-5.568.85
3Claude Opus 4.768.85
4GLM-5.263.93
5Claude Opus 4.663.39
6GLM-5.161.2
7Gemini 3.1 Pro (Preview)60.11
8LongCat 2.059.02
9Claude Sonnet 4.656.83
10GPT-5.456.83
11MiniMax-M356.28
12DeepSeek V4 Flash56.28
13DeepSeek V4 Pro54.64
14Kimi K2.646.45
15Qwen 3.6 Plus45.9

Interactive version: theaggregate.ai/benchmark?slug=forte-pass-pow-3 · How It Works · Data refreshed daily, snapshot 2026-09-19.