OpenRouter Tau2-Bench Airline: leaderboard

OpenRouter's own τ²-Bench Airline run: 50 multi-turn airline customer-service tasks where the model must use tools and follow policy, executed against the production endpoints it serves.

Metric: Accuracy (%). Source: openrouter.ai. Status: saturation imminent. 122 models tracked.

Top models

#ModelScore
1Gemini 3.7 Flash80.6
2Claude Fable 580
3Claude Opus 579.2
4Nova Micro78.7
5Qwen 3.5 397B A17B78.5
6Claude Fable 5.178.3
7Qwen 3.5 122B A10B77.3
8Gemini 3 Flash (Preview)77.3
9Step 3.7 Flash77.3
10DeepSeek V4 Pro (0813)77.2
11Claude Opus 4.577.1
12GLM-5.377.1
13Nemotron 3 Ultra76.9
14Qwen 3.8 27B76.8
15GPT-5.6 Sol76.7

Interactive version: theaggregate.ai/benchmark?slug=openrouter-tau2-bench-airline · How It Works · Data refreshed daily, snapshot 2026-09-20.