FORTE - Pass@3: leaderboard

Metric: Pass@3 (%, task solved in at least one of three runs). Source: agi-eval-official.github.io. 21 models tracked.

Top models

#ModelScore
1GPT-5.585.25
2GLM-5.185.25
3GLM-5.285.25
4Claude Opus 4.884.7
5LongCat 2.084.7
6Claude Opus 4.783.61
7DeepSeek V4 Pro83.06
8MiniMax-M382.51
9Gemini 3.1 Pro (Preview)81.97
10DeepSeek V4 Flash81.96
11Claude Opus 4.680.87
12Kimi K2.680.33
13GPT-5.479.23
14Claude Sonnet 4.678.14
15Qwen 3.6 Plus75.96

Interactive version: theaggregate.ai/benchmark?slug=forte-pass-3 · How It Works · Data refreshed daily, snapshot 2026-09-19.