NLCO - Set-L - Feasibility Rate: leaderboard

Metric: Average feasibility rate: output satisfies every constraint (%). Source: arxiv.org. Saturation forecast: Estimated already saturated. 16 models tracked.

Top models

#ModelScore
1GPT-5.1 (Medium)95.5
2Gemini 3 Flash (High)95.4
3Claude Sonnet 4.5 (Thinking)93.2
4DeepSeek V3.2 (Thinking)92.9
5O4 Mini (High)92.5
6Grok 4.1 Fast (Reasoning)83.7
7Qwen 3 235B A22B 2507 Instruct79.7
8DeepSeek V3.2 (Non-reasoning)78.5
9Qwen 3 14B (Reasoning)69.4
10QwQ-32B61.1
11MiMo-V2-Flash (Non-reasoning)54.3
12Llama 4 Maverick Instruct52.7
13Qwen 3 14B (Non-reasoning)48.9
14Ministral-3-14B-Instruct-251246.6

Interactive version: theaggregate.ai/benchmark?slug=nlco-set-l-feasibility-rate · How It Works · Data refreshed daily, snapshot 2026-09-25.