kullama2-7B-platypus-kogpt4: benchmark results

Provider: Other. Access: Open.

Unified ELO 1363 ± 17, rank #2151 of 2656 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM - KorNAT-Helpful49.53Normalized accuracy (%)80.1
Open Korean LLM - Ko-GPQA-Diamond23.74Normalized accuracy (%)55.6
Open Korean LLM - Ko-Winogrande57.62Accuracy (%)32.9
Open Korean LLM - KorNAT-CKA20.09Normalized accuracy (%)28.1
Open Korean LLM Leaderboard31.09Average Score (%)25
Open Ko-LLM Leaderboard31.09Average (%)24.7
Open Korean LLM - Ko-EQ-Bench0EQ-Bench score24.5
Open Korean LLM - Ko-GSM8K (flexible extract)5.16Exact match, flexible extract (%)24.3
Open Korean LLM - KorNAT-Harmless60.67Normalized accuracy (%)17
Open Korean LLM - Ko-IFEval15.64Strict accuracy, prompt/instruction mean (%)10.6

Interactive version: theaggregate.ai/model?slug=kullama2-7b-platypus-kogpt4 · How It Works · Data refreshed daily, snapshot 2026-09-19.