AgentIdeaBench - Active - Originality: leaderboard

Metric: Originality Critic Score (1-10). Source: moyunxiang.com. 63 models tracked.

Top models

#ModelScore
1Claude Opus 57.3
2GPT-5.6 Sol6.93
3Claude Opus 4.86.81
4GPT-5.6 Terra6.81
5Claude Opus 4.76.71
6GPT-5.56.7
7Claude Sonnet 56.7
8GPT-5.26.58
9GPT-5.46.51
10Gemini 3 Flash (Preview)6.33
11GLM-5.16.31
12GPT-56.29
13GPT-5.6 Luna6.28
14Gemini 3.1 Pro (Preview)6.2
15GPT-5.4 Mini6.2

Interactive version: theaggregate.ai/benchmark?slug=agentideabench-active-originality · How It Works · Data refreshed daily, snapshot 2026-09-19.