llama3.1-korean-v1.1-sft-by-aidx: benchmark results

Provider: Meta. Released 2024-09-29. Access: Open.

Unified ELO 1622 ± 17, rank #545 of 2656 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM - KorNAT-CKA42.06Normalized accuracy (%)99.6
Open Ko-LLM Leaderboard53.94Average (%)99.2
Open Korean LLM Leaderboard53.94Average Score (%)99.2
Open Korean LLM - Ko-GSM8K (flexible extract)69.45Exact match, flexible extract (%)98.1
Open Korean LLM - Ko-IFEval62.8Strict accuracy, prompt/instruction mean (%)97.3
Open Korean LLM - Ko-EQ-Bench55.86EQ-Bench score96.9
Open Korean LLM - Ko-GPQA-Diamond27.78Normalized accuracy (%)95
Open Korean LLM - Ko-Winogrande68.75Accuracy (%)93.9
Open Korean LLM - KorNAT-Harmless65.8Normalized accuracy (%)82.5
Open Korean LLM - KorNAT-Helpful48.27Normalized accuracy (%)66.9

Interactive version: theaggregate.ai/model?slug=llama3-1-korean-v1-1-sft-by-aidx · How It Works · Data refreshed daily, snapshot 2026-09-19.