A3S-Bench - Baseline Operators - RTR@1: leaderboard

Metric: Risk Trigger Rate (%; cases triggered in at least 1 of 3 runs). Source: arxiv.org. Saturation forecast: Estimated already saturated. 11 models tracked.

Top models

#ModelScore
1GPT-5.44.2
2GLM-5.15.6
3Claude Sonnet 4.57.92
4GPT-5.28.83
5DeepSeek V4 Flash24.92
6Kimi K2.525.99
7Qwen 3.5 397B A17B27.48
8MiniMax-M2.532.39
9Qwen 3.5 122B A10B36.58
10DeepSeek V3.237.54
11Qwen 3.5 35B A3B45.27

Interactive version: theaggregate.ai/benchmark?slug=a3s-bench-baseline-operators-rtr-1 · How It Works · Data refreshed daily, snapshot 2026-09-25.