IdeaAMBIG - Clarification Action Generation - Real-World: leaderboard

Metric: Macro Clarification Action Success Rate (%). Source: arxiv.org. 13 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol80.6
2Claude Sonnet 576.8
3Qwen 3.5 397B A17B72
4Gemini 3.1 Pro (Preview)68.9
5DeepSeek R1 052868
6Gemma 4 31B (IT)67.7
7Qwen 3.5 9B64.6
8GLM-5.263.6
9DeepSeek V3.262.9
10Qwen 3 32B61.9
11Kimi K360.6
12Qwen 3 8B53.8
13GPT-OSS-120B53.4

Interactive version: theaggregate.ai/benchmark?slug=ideaambig-clarification-action-generation-real-world · How It Works · Data refreshed daily, snapshot 2026-09-19.