NLCO - Set-M - Feasibility Rate: leaderboard

Metric: Average feasibility rate: output satisfies every constraint (%). Source: arxiv.org. Saturation forecast: Estimated already saturated. 16 models tracked.

Top models

#ModelScore
1GPT-5.1 (Medium)98
2Gemini 3 Flash (High)97.5
3DeepSeek V3.2 (Thinking)96.8
4Claude Sonnet 4.5 (Thinking)96.7
5O4 Mini (High)96.5
6Grok 4.1 Fast (Reasoning)93.6
7Qwen 3 235B A22B 2507 Instruct87.6
8DeepSeek V3.2 (Non-reasoning)86.1
9Qwen 3 14B (Reasoning)79.1
10QwQ-32B73.8
11Llama 4 Maverick Instruct65.1
12MiMo-V2-Flash (Non-reasoning)62.8
13Ministral-3-14B-Instruct-251258.7
14Qwen 3 14B (Non-reasoning)58.1

Interactive version: theaggregate.ai/benchmark?slug=nlco-set-m-feasibility-rate · How It Works · Data refreshed daily, snapshot 2026-09-25.