IWC-Bench: leaderboard

Metric: Standardized total score (z, judge Claude-Opus-4.8). Source: arxiv.org. 17 models tracked.

Top models

#ModelScore
1Claude Opus 51.33
2GPT-5.6 Sol1.08
3Qwen 3.8 Max0.97
4Kimi K30.97
5Hy4 preview0.91
6Claude Opus 4.80.76
7Grok 4.50.75
8GPT-5.50.47
9Claude Opus 4.7-0.26
10GLM-5.2-0.31
11DeepSeek V4 Flash-0.35
12Hy3-0.59
13Qwen 3.7 Max-0.91
14GLM-5.1-0.94
15Kimi K2.7 Code-1.31

Interactive version: theaggregate.ai/benchmark?slug=iwc-bench · How It Works · Data refreshed daily, snapshot 2026-09-20.