ToolRobustBench - User Intent: leaderboard

Metric: Success rate (0-1, native; indirect, underspecified, distracting or conflicting request phrasing; over ToolRobustBench single-family perturbation instances (clean, light, medium, heavy); binary per-instance tool-call success). Source: arxiv.org. Saturation forecast: Estimated already saturated. 7 models tracked.

Top models

#ModelScore
1DeepSeek V4 Pro0.81
2Qwen Plus0.8
3Claude Sonnet 4.60.79
4DeepSeek V4 Flash0.78
5GPT-5.4 Mini0.78
6Gemini 2.5 Pro0.75
7Gemini 2.5 Flash0.7

Interactive version: theaggregate.ai/benchmark?slug=toolrobustbench-user-intent · How It Works · Data refreshed daily, snapshot 2026-09-26.