FORTE - Avg@3: leaderboard

Metric: Avg@3 (%, mean task success over three runs). Source: agi-eval-official.github.io. 21 models tracked.

Top models

#ModelScore
1GPT-5.577.78
2Claude Opus 4.777.6
3Claude Opus 4.877.23
4GLM-5.276.87
5GLM-5.173.77
6Claude Opus 4.673.22
7LongCat 2.073.22
8MiniMax-M371.22
9DeepSeek V4 Flash70.67
10DeepSeek V4 Pro70.49
11Gemini 3.1 Pro (Preview)70.31
12GPT-5.468.85
13Claude Sonnet 4.668.31
14Kimi K2.663.93
15Qwen 3.6 Plus62.48

Interactive version: theaggregate.ai/benchmark?slug=forte-avg-3 · How It Works · Data refreshed daily, snapshot 2026-09-19.