IdeaAMBIG - Readiness Assessment - Controlled Synthetic: leaderboard

Metric: Macro-F1 (%; 100 Ready and 100 NotReady specifications per subset). Source: arxiv.org. 13 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol86.4
2Claude Sonnet 576.2
3Gemini 3.1 Pro (Preview)67.3
4DeepSeek V3.267.2
5GLM-5.265.9
6DeepSeek R1 052859.9
7Gemma 4 31B (IT)56.9
8Qwen 3.5 397B A17B55.9
9Qwen 3.5 9B54.3
10Qwen 3 8B48.7
11GPT-OSS-120B44.4
12Kimi K343.1
13Qwen 3 32B37

Interactive version: theaggregate.ai/benchmark?slug=ideaambig-readiness-assessment-controlled-synthetic · How It Works · Data refreshed daily, snapshot 2026-09-19.