Qwen-2.5-Base-7B-SFT-Korean-Article-Dataset: benchmark results

Provider: Alibaba. Access: Open.

Unified ELO 1407 ± 18, rank #1848 of 2656 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM - KorNAT-Helpful49.73Normalized accuracy (%)81.4
Open Korean LLM - KorNAT-CKA25.57Normalized accuracy (%)58.9
Open Korean LLM - Ko-Winogrande60.93Accuracy (%)58.7
Open Korean LLM - Ko-EQ-Bench9.9EQ-Bench score55.8
Open Korean LLM - KorNAT-Harmless62.77Normalized accuracy (%)49.9
Open Korean LLM Leaderboard34Average Score (%)45.7
Open Ko-LLM Leaderboard34Average (%)45.5
Open Korean LLM - Ko-IFEval25.15Strict accuracy, prompt/instruction mean (%)33.3
Open Korean LLM - Ko-GPQA-Diamond21.21Normalized accuracy (%)24
Open Korean LLM - Ko-GSM8K (flexible extract)0.08Exact match, flexible extract (%)4.8

Interactive version: theaggregate.ai/model?slug=qwen-2-5-base-7b-sft-korean-article-dataset · How It Works · Data refreshed daily, snapshot 2026-09-19.