Horangi 4 - IFEval-Ko: leaderboard
Metric: Instruction-following accuracy (%). Source: horangi.ai. 105 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-5.4 (xHigh) | 95 |
| 2 | GPT-5.1 | 93.75 |
| 3 | GPT-5.5 (xHigh) | 93.33 |
| 4 | GPT-5 | 92.92 |
| 5 | GLM-5-Turbo | 92.92 |
| 6 | Grok 4.20 | 92.5 |
| 7 | Grok 4.5 | 92.5 |
| 8 | GPT-5.2 (xHigh) | 92.5 |
| 9 | GPT-5.4 Mini (xHigh) | 92.5 |
| 10 | GPT-5.4 Nano (xHigh) | 92.5 |
| 11 | GPT-5.6 Sol (Max) | 91.67 |
| 12 | Gemini 3.5 Flash | 91.25 |
| 13 | GPT-5.6 Terra (Max) | 91.25 |
| 14 | Gemini 3.1 Pro (Preview) (High) | 91.25 |
| 15 | Gemma 4 31B (IT) (Thinking) | 91.25 |
Interactive version: theaggregate.ai/benchmark?slug=horangi-4-ifeval-ko · How It Works · Data refreshed daily, snapshot 2026-09-19.