AgentIdeaBench - Active - Feasibility: leaderboard
Metric: Feasibility Critic Score (1-10). Source: moyunxiang.com. 63 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-5.4 | 7 |
| 2 | GPT-5.2 | 7 |
| 3 | Llama 4 Maverick | 6.87 |
| 4 | GPT-5.4 Mini | 6.85 |
| 5 | Claude Opus 4.8 | 6.83 |
| 6 | Qwen 2.5 72B Instruct | 6.77 |
| 7 | Claude Opus 5 | 6.77 |
| 8 | GPT-5.6 Terra | 6.76 |
| 9 | GPT-5 Mini | 6.75 |
| 10 | GPT-5.6 Sol | 6.72 |
| 11 | Gemini 2.5 Flash Lite | 6.71 |
| 12 | Claude Opus 4.6 | 6.7 |
| 13 | GPT-4o Mini | 6.66 |
| 14 | GPT-5.4 Nano | 6.64 |
| 15 | GPT-5.5 | 6.63 |
Interactive version: theaggregate.ai/benchmark?slug=agentideabench-active-feasibility · How It Works · Data refreshed daily, snapshot 2026-09-19.