Open Korean LLM - Ko-IFEval: leaderboard
Metric: Strict accuracy, prompt/instruction mean (%). Source: huggingface.co. 1162 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | gemma2-gutenberg-27B | 74.68 |
| 2 | gemma-2-27B-it-abliterated | 72.87 |
| 3 | Gemma 2 27B (IT) | 72.48 |
| 4 | recoilme-gemma-2-9B-v0.2 | 69.49 |
| 5 | Gemma 2 9B (IT) | 68.42 |
| 6 | Qwen2.5-14B-Gutenberg-Instruct-Slerpeno | 68.42 |
| 7 | T3Q-ko-gemma2-9B-it-safe-v1 | 68.42 |
| 8 | Rombos-LLM-V2.6-Qwen-14B | 68.27 |
| 9 | Qwen2.5-Lumen-14B | 68.22 |
| 10 | Gemma-2-9B-It-SPPO-Iter1 | 68.14 |
| 11 | Qwen2.5-14B-Gutenberg-1e-Delta | 68.07 |
| 12 | gemma-2-9b_dpo-v4-hq | 67.89 |
| 13 | SuperNova-Medius | 67.52 |
| 14 | Gemma-2-9B-It-SPPO-Iter3 | 67.39 |
| 15 | qwen2.5-reinstruct-alternate-lumen-14B | 67.07 |
Interactive version: theaggregate.ai/benchmark?slug=open-korean-llm-ko-ifeval · How It Works · Data refreshed daily, snapshot 2026-09-19.