AgentIdeaBench - Active - Feasibility: leaderboard

Metric: Feasibility Critic Score (1-10). Source: moyunxiang.com. 63 models tracked.

Top models

#ModelScore
1GPT-5.47
2GPT-5.27
3Llama 4 Maverick6.87
4GPT-5.4 Mini6.85
5Claude Opus 4.86.83
6Qwen 2.5 72B Instruct6.77
7Claude Opus 56.77
8GPT-5.6 Terra6.76
9GPT-5 Mini6.75
10GPT-5.6 Sol6.72
11Gemini 2.5 Flash Lite6.71
12Claude Opus 4.66.7
13GPT-4o Mini6.66
14GPT-5.4 Nano6.64
15GPT-5.56.63

Interactive version: theaggregate.ai/benchmark?slug=agentideabench-active-feasibility · How It Works · Data refreshed daily, snapshot 2026-09-19.