Open Korean LLM Leaderboard: leaderboard
Korean language LLM evaluation across Ko-GPQA, Ko-Winogrande, Ko-GSM8K, Ko-EQ Bench, Ko-IFEval, and KorNAT tasks.
Metric: Average Score (%). Source: huggingface.co. Status: saturated. 1166 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemma 2 27B (IT) | 53.37 |
| 2 | Qwen2.5-14B-Gutenberg-1e-Delta | 53.14 |
| 3 | recoilme-gemma-2-9B-v0.4 | 52.88 |
| 4 | SuperNova-Medius | 52.61 |
| 5 | Qwen2.5-Lumen-14B | 52.57 |
| 6 | Qwen 2.5 14B Instruct | 51.51 |
| 7 | recoilme-gemma-2-9B-v0.2 | 51.43 |
| 8 | Rombos-LLM-V2.6-Qwen-14B | 51.08 |
| 9 | lambda-qwen2.5-14B-dpo-test | 50.37 |
| 10 | Gemma 2 9B (IT) | 49.74 |
| 11 | ko-gemma-2-9B-it | 49.49 |
| 12 | Qwen2.5-7B-Instruct-Uncensored | 49.41 |
| 13 | Gemmasutra-9B-v1 | 49.32 |
| 14 | Llama-3.1-SuperNova-Lite | 48.88 |
| 15 | EEVE-Korean-Instruct-10.8B-v1.0 | 48.49 |
Interactive version: theaggregate.ai/benchmark?slug=open-korean-llm-leaderboard · How It Works · Data refreshed daily, snapshot 2026-09-05.