MTAC-IFBench - C-ISR (Claude Code): leaderboard
Metric: Constraint-Instruction Success Rate (%, all constraints met, average over turn buckets). Source: arxiv.org. 11 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GLM-5.2 | 12.7 |
| 2 | Gemini 3.1 Pro (Preview) | 11.1 |
| 3 | GLM-5.1 | 8.9 |
| 4 | Claude Opus 4.6 | 8.7 |
| 5 | Kimi K2.6 | 7.8 |
| 6 | DeepSeek V4 Pro | 6.4 |
| 7 | DeepSeek V4 Flash | 3.4 |
| 8 | Seed 2.0 Pro | 2.6 |
| 9 | Qwen 3.6 Plus | 2 |
| 10 | Claude Haiku 4.5 | 1.9 |
| 11 | Qwen 3.5 27B | 1.1 |
Interactive version: theaggregate.ai/benchmark?slug=mtac-ifbench-c-isr-claude-code · How It Works · Data refreshed daily, snapshot 2026-09-20.