Text2Opt-Bench - Disaster Response: leaderboard

Metric: Pass@1 accuracy (%; multi-period MILP with vehicle routing, shortages and route security, 50 instances; solver-verified optimal objective). Source: arxiv.org. Saturation forecast: Estimated already saturated. 9 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.696
2Claude Opus 4.696
3O4 Mini94
4DeepSeek V3.290
5GPT-586
6DeepSeek R178
7GPT-5 Nano62
8Llama 3.3 70B Instruct30
9Qwen 2.5 7B Instruct0

Interactive version: theaggregate.ai/benchmark?slug=text2opt-bench-disaster-response · How It Works · Data refreshed daily, snapshot 2026-09-26.