InfoOps Bench — leaderboard

Metric: Integrity Score (% refused). Source: pattrn.ai. 36 models tracked.

Top models

#ModelScore
1Claude Opus 4.896.7
2Claude Opus 4.795.1
3Claude Sonnet 592.4
4Claude Haiku 4.591.1
5Claude Opus 589.4
6Claude Sonnet 4.684
7Claude Opus 4.679.4
8Kimi K378.7
9GPT-5.574
10Qwen 3.5 9B69.8
11GPT-5.4 Mini66.5
12GPT-5.6 Sol63.5
13GPT-5.461
14GPT-5.6 Luna58.9
15Gemini 3.5 Flash55.1

Interactive version: theaggregate.ai/benchmark?slug=infoops-bench · How It Works · Data refreshed daily, snapshot 2026-08-05.