Tau-Bench Retail — leaderboard

Agentic customer service benchmark in a simulated retail environment. Models handle multi-turn conversations with tool-calling to resolve customer requests. From Sierra AI (tau2-bench).

Metric: Pass@1 (%). Source: taubench.com. Status: saturation imminent. 16 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.586.2
2Gemini 3 Pro85.3
3Claude Opus 4.182.4
4GPT-581.6
5Claude Opus 481.4
6DeepSeek V3.281.1
7Claude Sonnet 480.5
8Qwen 3 Max (Thinking)79.4
9GPT-4.174
10O373.9
11Qwen 3 Max72.2
12Claude 3.7 Sonnet72.1
13Kimi K270.6
14O4 Mini68.3
15GPT-4.1 Mini61.4

Interactive version: theaggregate.ai/benchmark?slug=tau-bench-retail · How the rankings work · Data refreshed daily, snapshot 2026-07-22.