Text2Opt-Bench: leaderboard

Metric: Pass@1 accuracy (%; mean over the eleven template categories, 50 small-tier instances each, 550 problems; solver-verified optimal objective). Source: arxiv.org. Saturation forecast: Around December 2026. 9 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.687.6
2Claude Opus 4.686.7
3GPT-586.2
4O4 Mini80.4
5DeepSeek R172.9
6DeepSeek V3.272
7GPT-5 Nano59.1
8Llama 3.3 70B Instruct35.1
9Qwen 2.5 7B Instruct4.5

Interactive version: theaggregate.ai/benchmark?slug=text2opt-bench · How It Works · Data refreshed daily, snapshot 2026-09-26.