AgentIdeaBench - Active - Specificity: leaderboard

Metric: Specificity Critic Score (1-10). Source: moyunxiang.com. 63 models tracked.

Top models

#ModelScore
1Claude Opus 57.63
2GPT-5.6 Sol7.47
3GPT-5.6 Terra7.37
4Claude Opus 4.77.3
5Claude Opus 4.87.24
6Claude Sonnet 57.21
7GPT-5.57.12
8GPT-5.27.11
9GPT-57.06
10GPT-5.46.99
11GPT-5 Mini6.97
12GPT-5.6 Luna6.91
13GLM-5.16.71
14GPT-5.4 Mini6.68
15Gemini 3 Flash (Preview)6.6

Interactive version: theaggregate.ai/benchmark?slug=agentideabench-active-specificity · How It Works · Data refreshed daily, snapshot 2026-09-19.