NLCO - Set-S - Feasibility Rate: leaderboard

Metric: Average feasibility rate: output satisfies every constraint (%). Source: arxiv.org. Saturation forecast: Estimated already saturated. 16 models tracked.

Top models

#ModelScore
1O4 Mini (High)98.9
2GPT-5.1 (Medium)98.9
3Gemini 3 Flash (High)98.8
4Claude Sonnet 4.5 (Thinking)98.7
5DeepSeek V3.2 (Thinking)98.7
6Grok 4.1 Fast (Reasoning)98.3
7Qwen 3 235B A22B 2507 Instruct95.3
8DeepSeek V3.2 (Non-reasoning)93.4
9Qwen 3 14B (Reasoning)90.7
10QwQ-32B89.9
11Llama 4 Maverick Instruct78.8
12MiMo-V2-Flash (Non-reasoning)75
13Ministral-3-14B-Instruct-251272
14Qwen 3 14B (Non-reasoning)70.4

Interactive version: theaggregate.ai/benchmark?slug=nlco-set-s-feasibility-rate · How It Works · Data refreshed daily, snapshot 2026-09-25.