Text2Opt-Bench - Queuing and Staffing: leaderboard

Metric: Pass@1 accuracy (%; nonlinear staffing with Erlang-C service levels, 50 instances; solver-verified optimal objective). Source: arxiv.org. Saturation forecast: Estimated already saturated. 9 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.698
2Claude Opus 4.692
3GPT-580
4O4 Mini76
5DeepSeek R170
6DeepSeek V3.266
7GPT-5 Nano56
8Llama 3.3 70B Instruct10
9Qwen 2.5 7B Instruct0

Interactive version: theaggregate.ai/benchmark?slug=text2opt-bench-queuing-and-staffing · How It Works · Data refreshed daily, snapshot 2026-09-26.