AgentIdeaBench - Static - Specificity: leaderboard

Metric: Specificity Critic Score (1-10). Source: moyunxiang.com. 63 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol7.45
2GPT-5.6 Terra7.31
3Claude Opus 57.26
4GPT-5.6 Luna7.19
5GPT-57.12
6GPT-5.57.04
7GPT-5.46.57
8GPT-5.26.55
9Claude Sonnet 56.25
10GPT-5.4 Mini6.18
11GPT-5 Mini6.15
12Claude Opus 4.76.12
13Claude Opus 4.66.05
14O36
15Gemini 3.5 Flash5.99

Interactive version: theaggregate.ai/benchmark?slug=agentideabench-static-specificity · How It Works · Data refreshed daily, snapshot 2026-09-19.