LLM Stats (TAU-bench Retail): leaderboard

Metric: Score (%). Source: llm-stats.com. 25 models tracked.

Top models

#ModelScore
1Claude Opus 4.182.4
2Claude Opus 481.4
3Claude 3.7 Sonnet81.2
4Claude Sonnet 480.5
5GLM-4.579.7
6GLM 4.5 Air77.9
7Qwen 3 Coder 480B A35B Instruct77.5
8O4 Mini71.8
9O170.8
10Qwen 3 Next 80B A3B (Thinking)69.6
11Claude 3.5 Sonnet69.2
12GPT-4.568.4
13GPT-4.168
14GPT-OSS-120B67.8
15Qwen 3 235B A22B 2507 (Thinking)67.8

Interactive version: theaggregate.ai/benchmark?slug=llm-stats-tau-bench-retail · How It Works · Data refreshed daily, snapshot 2026-09-19.