IdeaAMBIG - Readiness Assessment - Real-World: leaderboard

Metric: Macro-F1 (%; 100 Ready and 100 NotReady specifications per subset). Source: arxiv.org. 13 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol67.5
2Claude Sonnet 559.3
3Qwen 3.5 397B A17B57.5
4Gemma 4 31B (IT)47.1
5Gemini 3.1 Pro (Preview)45.8
6GLM-5.245.1
7DeepSeek V3.244.5
8DeepSeek R1 052844.3
9Qwen 3 8B40.1
10Qwen 3 32B34.5
11Qwen 3.5 9B33.3
12Kimi K332.7
13GPT-OSS-120B30

Interactive version: theaggregate.ai/benchmark?slug=ideaambig-readiness-assessment-real-world · How It Works · Data refreshed daily, snapshot 2026-09-19.