Platypus2-13B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1366 ± 17, rank #2134 of 2656 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM - Ko-IFEval29.9Strict accuracy, prompt/instruction mean (%)53.4
Open Korean LLM - KorNAT-Harmless62.84Normalized accuracy (%)50.7
Open Korean LLM - Ko-Winogrande58.72Accuracy (%)40.8
Open Korean LLM - Ko-GSM8K (flexible extract)11.9Exact match, flexible extract (%)38
Open Korean LLM Leaderboard31.32Average Score (%)27
Open Ko-LLM Leaderboard31.32Average (%)26.8
Open Korean LLM - Ko-EQ-Bench0EQ-Bench score24.5
Open Korean LLM - KorNAT-CKA16.06Normalized accuracy (%)11.6
Open Korean LLM - KorNAT-Helpful40.52Normalized accuracy (%)7.8
Open Korean LLM - Ko-GPQA-Diamond19.19Normalized accuracy (%)6.4

Interactive version: theaggregate.ai/model?slug=platypus2-13b · How It Works · Data refreshed daily, snapshot 2026-09-19.