Open Ko-LLM Leaderboard: leaderboard

Korean LLM leaderboard run by Upstage on Hugging Face (2023); Average combines Ko-ARC, Ko-HellaSwag, Ko-MMLU, Ko-TruthfulQA and Ko-CommonGen v2 (Season 1) or nine tasks such as Ko-GPQA (Season 2).

Metric: Average Score (%). Source: huggingface.co. Status: saturated. 1166 models tracked.

Top models

#ModelScore
1Gemma 2 27B (IT)53.37
2Qwen2.5-14B-Gutenberg-1e-Delta53.14
3recoilme-gemma-2-9B-v0.452.88
4SuperNova-Medius52.61
5Qwen2.5-Lumen-14B52.57
6Qwen 2.5 14B Instruct51.51
7recoilme-gemma-2-9B-v0.251.43
8Rombos-LLM-V2.6-Qwen-14B51.08
9lambda-qwen2.5-14B-dpo-test50.37
10Gemma 2 9B (IT)49.74
11ko-gemma-2-9B-it49.49
12Qwen2.5-7B-Instruct-Uncensored49.41
13Gemmasutra-9B-v149.32
14Llama-3.1-SuperNova-Lite48.88
15EEVE-Korean-Instruct-10.8B-v1.048.49

Interactive version: theaggregate.ai/benchmark?slug=open-ko-llm-leaderboard · How It Works · Data refreshed daily, snapshot 2026-09-05.