AgentIdeaBench - Static - Feasibility: leaderboard

Metric: Feasibility Critic Score (1-10). Source: moyunxiang.com. 63 models tracked.

Top models

#ModelScore
1GPT-5.6 Terra6.53
2GPT-5.6 Luna6.48
3GPT-5.6 Sol6.31
4GPT-56.08
5Claude Opus 55.95
6GPT-5.55.93
7Claude Sonnet 55.78
8GPT-4o5.77
9Claude Opus 4.65.75
10GPT-5.45.68
11GPT-5.25.68
12GPT-5 Nano5.62
13GPT-5.4 Mini5.62
14Qwen 2.5 72B Instruct5.58
15Claude Opus 4.55.55

Interactive version: theaggregate.ai/benchmark?slug=agentideabench-static-feasibility · How It Works · Data refreshed daily, snapshot 2026-09-19.