InfoOps Bench: leaderboard

Metric: Integrity Score (% refused). Source: pattrn.ai. 38 models tracked.

Top models

#ModelScore
1Claude Opus 4.896.7
2Claude Opus 4.795.1
3Claude Haiku 4.591.1
4Claude Sonnet 590.5
5Claude Opus 587.3
6Claude Sonnet 4.684
7Qwen 3.5 Flash79.7
8Claude Opus 4.679.4
9Kimi K374.4
10GPT-5.574
11Qwen 3.5 9B69.8
12GPT-5.4 Mini66.2
13GPT-5.461
14GPT-5.6 Sol56.7
15Gemini 3.5 Flash55.5

Interactive version: theaggregate.ai/benchmark?slug=infoops-bench · How It Works · Data refreshed daily, snapshot 2026-09-19.