BenchCompass - Task-Input Attack (Open Book): leaderboard

Metric: Accuracy (%). Source: arxiv.org. 14 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)81.7
2GPT-5.580
3DeepSeek V4 Pro80
4Gemma 4 31B (IT)74.8
5Claude Opus 4.774.8
6Qwen 3.5 397B A17B72.2
7GLM-5.170.4
8Qwen 3.5 122B A10B70.4
9Gemma 4 26B A4B (IT)60.9
10MiniMax-M2.560.9
11Mistral Large 351.3
12Llama 4 Maverick46.1
13Qwen 3 32B42.6
14Qwen 3 8B36.5

Interactive version: theaggregate.ai/benchmark?slug=benchcompass-task-input-attack-open-book · How It Works · Data refreshed daily, snapshot 2026-09-20.