OpenEval - IFEval Strict: leaderboard

Metric: Strict Accuracy (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct89.93
2Qwen 3 4B Instruct87.15
3Qwen 2.5 14B Instruct86.11
4Qwen 2.5 32B Instruct85.83
5Qwen 2 72B Instruct82.5
6Qwen 2.5 72B Instruct Turbo80.62
7Qwen 2.5 7B Instruct79.08
8Qwen 2.5 7B Instruct Turbo74.09
9Qwen 2.5 3B Instruct69.99
10Qwen 2 7B Instruct63.77
11Qwen 1.5 32B Chat54.34
12Qwen 2.5 1.5B Instruct53.33
13Qwen 1.5 14B Chat45.44
14Qwen-14B-Chat42.3
15Qwen 1.5 7B Chat41.53

Interactive version: theaggregate.ai/benchmark?slug=openeval-ifeval-strict · How It Works · Data refreshed daily, snapshot 2026-09-05.