AgentIdeaBench - Active: leaderboard

Metric: Weighted Hypothesis Score (1-10). Source: moyunxiang.com. 63 models tracked.

Top models

#ModelScore
1Claude Opus 57.14
2GPT-5.6 Sol6.88
3GPT-5.6 Terra6.8
4Claude Opus 4.86.79
5Claude Opus 4.76.7
6GPT-5.56.68
7Claude Sonnet 56.66
8GPT-5.26.66
9GPT-5.46.62
10GPT-5.6 Luna6.43
11GPT-56.4
12GPT-5 Mini6.38
13GPT-5.4 Mini6.36
14GLM-5.16.33
15Gemini 3 Flash (Preview)6.29

Interactive version: theaggregate.ai/benchmark?slug=agentideabench-active · How It Works · Data refreshed daily, snapshot 2026-09-19.