Tau-Bench Telecom — leaderboard

Agentic customer service benchmark in a simulated telecom environment. Models handle complex multi-turn conversations with tool-calling. From Sierra AI (tau2-bench).

Metric: Pass@1 (%). Source: taubench.com. Status: saturated. 12 models tracked.

Top models

#ModelScore
1Qwen 3 Max (Thinking)98.2
2Claude Sonnet 4.598
3Gemini 3 Pro98
4DeepSeek V3.296.2
5GPT-595.8
6Qwen 3 Max84.2
7Kimi K265.8
8O4 Mini50.2
9Claude 3.7 Sonnet49
10GPT-4.1 Mini48.9
11GPT-4.134

Interactive version: theaggregate.ai/benchmark?slug=tau-bench-telecom · How the rankings work · Data refreshed daily, snapshot 2026-07-22.