AgentIdeaBench - Static: leaderboard

Metric: Weighted Hypothesis Score (1-10). Source: moyunxiang.com. 63 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol6.9
2Claude Opus 56.89
3GPT-5.6 Terra6.86
4GPT-5.56.7
5GPT-5.6 Luna6.7
6GPT-56.55
7GPT-5.46.18
8GPT-5.26.16
9GPT-5.4 Mini6.06
10Claude Sonnet 56.05
11GPT-5 Mini5.88
12Gemini 3.5 Flash5.87
13Claude Opus 4.75.83
14Claude Opus 4.65.8
15Claude Opus 4.85.78

Interactive version: theaggregate.ai/benchmark?slug=agentideabench-static · How It Works · Data refreshed daily, snapshot 2026-09-19.