mergekit_v2: benchmark results

Provider: Other. Access: Open.

Unified ELO 1338 ± 20, rank #2300 of 2656 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM - Ko-Winogrande64.17Accuracy (%)77.4
Open Korean LLM - KorNAT-Helpful48.6Normalized accuracy (%)70.2
Open Korean LLM - KorNAT-CKA26.2Normalized accuracy (%)62.8
Open Korean LLM - Ko-IFEval31.37Strict accuracy, prompt/instruction mean (%)59.4
Open Korean LLM - KorNAT-Harmless63.13Normalized accuracy (%)56.9
Open Korean LLM - Ko-GSM8K (flexible extract)16.45Exact match, flexible extract (%)46.9
Open Korean LLM - Ko-GPQA-Diamond22.22Normalized accuracy (%)35
Open Korean LLM Leaderboard29Average Score (%)9.1
Open Ko-LLM Leaderboard29Average (%)9
Open Korean LLM - Ko-EQ-Bench-28.06EQ-Bench score0.4

Interactive version: theaggregate.ai/model?slug=mergekit-v2 · How It Works · Data refreshed daily, snapshot 2026-09-19.