IH-Benchmark — leaderboard

Metric: Overall Compliance (%). Source: arxiv.org. 37 models tracked.

Top models

#ModelScore
1Claude Opus 4.698.3
2GPT-5.497.6
3Claude Opus 4.597.3
4Claude Opus 4.796.7
5Claude Sonnet 4.696.1
6GPT-5.4 (Low)94.1
7Grok 4.1 Fast (Reasoning)89.9
8GPT-5.289.3
9GPT-5 Mini88.6
10Claude Haiku 4.588.3
11GPT-5.2 (Low)87.8
12Claude Sonnet 4.587.6
13GLM-586.6
14GLM-5.186
15GPT-5 Mini (Low)85.8

Interactive version: theaggregate.ai/benchmark?slug=ih-benchmark · How It Works · Data refreshed daily, snapshot 2026-08-05.