EvasionBench: leaderboard

Benchmark for evaluating model robustness against evasion-style safety and policy-circumvention prompts.

Metric: Macro-F1 (%). Source: iiiiqiiii.github.io. Status: saturation imminent. 12 models tracked.

Top models

#ModelScore
1Gemini 3 Flash84.64
2Claude Opus 4.584.38
3GLM-4.782.91
4GPT-5.280.9
5Qwen 3 Coder 480B A35B Instruct78.16
6Qwen3 Coder78.16
7MiniMax-M2.171.31
8DeepSeek V3.266.88
9Kimi K266.68
10Kimi K2 090566.68

Interactive version: theaggregate.ai/benchmark?slug=evasionbench · How It Works · Data refreshed daily, snapshot 2026-09-05.