AgentCIBench: leaderboard

Metric: Leakage (self-reported). Source: benchmarklist.com. 15 models tracked.

Top models

#ModelScore
1Claude Opus 4.713.7
2GPT-5.418.8
3Claude Sonnet 4.646.2
4MiniMax-M2.758.1
5GPT-5.4 Mini60.7
6Kimi K2.662.4
7GPT-OSS-120B65.8
8Gemma 4 26B67.5
9Qwen 3.6 35B A3B76.9
10DeepSeek V4 Pro82.9
11GLM-5.185.5
12Grok 4.391.5
13Gemini 3 Flash93.2
14Qwen 3.6 Max97.4
15Gemini 3.1 Pro (Preview)98.3

Interactive version: theaggregate.ai/benchmark?slug=agentcibench · How It Works · Data refreshed daily, snapshot 2026-09-05.