Text2Opt-Bench - Job-Shop Scheduling: leaderboard

Metric: Pass@1 accuracy (%; job-shop scheduling MILP with machine assignments and precedence, 50 instances; solver-verified optimal objective). Source: arxiv.org. Saturation forecast: Estimated already saturated. 9 models tracked.

Top models

#ModelScore
1Claude Opus 4.6100
2Claude Sonnet 4.698
3DeepSeek R196
4DeepSeek V3.296
5O4 Mini96
6GPT-590
7GPT-5 Nano82
8Llama 3.3 70B Instruct0
9Qwen 2.5 7B Instruct0

Interactive version: theaggregate.ai/benchmark?slug=text2opt-bench-job-shop-scheduling · How It Works · Data refreshed daily, snapshot 2026-09-26.