A3S-Bench - Agent-Specific Operators - RTR@1: leaderboard

Metric: Risk Trigger Rate (%; cases triggered in at least 1 of 3 runs). Source: arxiv.org. Saturation forecast: Around December 2026. 11 models tracked.

Top models

#ModelScore
1GPT-5.415.15
2GLM-5.116.67
3Claude Sonnet 4.519.68
4GPT-5.230.47
5Kimi K2.555.08
6Qwen 3.5 397B A17B55.24
7MiniMax-M2.559.49
8DeepSeek V4 Flash60.47
9DeepSeek V3.264.32
10Qwen 3.5 122B A10B67.37
11Qwen 3.5 35B A3B77.69

Interactive version: theaggregate.ai/benchmark?slug=a3s-bench-agent-specific-operators-rtr-1 · How It Works · Data refreshed daily, snapshot 2026-09-25.