CyScenarioBench — leaderboard

Irregular scenario-based offensive security benchmark measuring whether agents can plan and complete full multi-stage attack scenarios in realistic environments.

Metric: Average Success Rate (%). Source: epochai.substack.com. Status: saturation imminent. 9 models tracked.

Top models

#ModelScore
1Claude Mythos 536.7
2Claude Mythos Preview29.2
3GPT-5.526
4Claude Opus 4.816.6
5GPT-5.49
6GPT-5.20
7Gemini 3 Pro0
8Muse Spark0
9GPT-5.3 Codex0

Interactive version: theaggregate.ai/benchmark?slug=cyscenariobench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.