llama2-chat-koalpaca: benchmark results

Provider: Meta. Access: Open.

Unified ELO 1388 ± 17, rank #1993 of 2656 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM - Ko-EQ-Bench13.47EQ-Bench score59.2
Open Korean LLM - Ko-IFEval29.97Strict accuracy, prompt/instruction mean (%)53.5
Open Korean LLM - KorNAT-Harmless62.68Normalized accuracy (%)48.8
Open Korean LLM - Ko-GPQA-Diamond22.73Normalized accuracy (%)40.9
Open Korean LLM Leaderboard32.99Average Score (%)37.1
Open Ko-LLM Leaderboard32.99Average (%)36.8
Open Korean LLM - KorNAT-Helpful44.57Normalized accuracy (%)30.8
Open Korean LLM - Ko-GSM8K (flexible extract)5.99Exact match, flexible extract (%)25.9
Open Korean LLM - KorNAT-CKA18.01Normalized accuracy (%)17.5
Open Korean LLM - Ko-Winogrande54.46Accuracy (%)16.3

Interactive version: theaggregate.ai/model?slug=llama2-chat-koalpaca · How It Works · Data refreshed daily, snapshot 2026-09-19.