Open Korean LLM - Ko-IFEval: leaderboard

Metric: Strict accuracy, prompt/instruction mean (%). Source: huggingface.co. 1162 models tracked.

Top models

#ModelScore
1gemma2-gutenberg-27B74.68
2gemma-2-27B-it-abliterated72.87
3Gemma 2 27B (IT)72.48
4recoilme-gemma-2-9B-v0.269.49
5Gemma 2 9B (IT)68.42
6Qwen2.5-14B-Gutenberg-Instruct-Slerpeno68.42
7T3Q-ko-gemma2-9B-it-safe-v168.42
8Rombos-LLM-V2.6-Qwen-14B68.27
9Qwen2.5-Lumen-14B68.22
10Gemma-2-9B-It-SPPO-Iter168.14
11Qwen2.5-14B-Gutenberg-1e-Delta68.07
12gemma-2-9b_dpo-v4-hq67.89
13SuperNova-Medius67.52
14Gemma-2-9B-It-SPPO-Iter367.39
15qwen2.5-reinstruct-alternate-lumen-14B67.07

Interactive version: theaggregate.ai/benchmark?slug=open-korean-llm-ko-ifeval · How It Works · Data refreshed daily, snapshot 2026-09-19.