NLCO - Solver-Calling Code (Set-L) - Accuracy: leaderboard

Metric: Accuracy of generated Gurobi solver code: feasible and optimal (%). Source: arxiv.org. Saturation forecast: Around December 2026. 16 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (High)83.77
2Claude Sonnet 4.5 (Thinking)80.9
3GPT-5.1 (Medium)76.88
4DeepSeek V3.2 (Thinking)76.19
5Qwen 3 235B A22B 2507 Instruct69.26
6Grok 4.1 Fast (Reasoning)67.26
7DeepSeek V3.2 (Non-reasoning)66.98
8O4 Mini (High)56.47
9QwQ-32B54.7
10Llama 4 Maverick Instruct53.07
11Qwen 3 14B (Reasoning)51.21
12MiMo-V2-Flash (Non-reasoning)41.72
13Ministral-3-14B-Instruct-251240.6
14Qwen 3 14B (Non-reasoning)39.58

Interactive version: theaggregate.ai/benchmark?slug=nlco-solver-calling-code-set-l-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-25.