suzume-llama-3-8B-japanese: benchmark results

Provider: Lightblue. Access: Open.

Unified ELO 1512 ± 17, rank #1025 of 2656 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard43.78Average Score (%)88.9
Open Ko-LLM Leaderboard43.78Average (%)88.7
Open Korean LLM - Ko-IFEval41.96Strict accuracy, prompt/instruction mean (%)85.3
Open Korean LLM - Ko-GSM8K (flexible extract)50.04Exact match, flexible extract (%)83.9
Open Korean LLM - Ko-EQ-Bench34.06EQ-Bench score83.6
Open Korean LLM - Ko-Winogrande60.3Accuracy (%)53
Open Korean LLM - KorNAT-Harmless62.91Normalized accuracy (%)51.7
Open Korean LLM - KorNAT-CKA24.3Normalized accuracy (%)51
Open Korean LLM - Ko-GPQA-Diamond23.23Normalized accuracy (%)48.1
Open Korean LLM - KorNAT-Helpful46.52Normalized accuracy (%)47.2
pfgen-bench - Completion Mode - Helpfulness0Helpfulness Score3.7
pfgen-bench - Completion Mode - Fluency0Fluency Score0.2

Interactive version: theaggregate.ai/model?slug=suzume-llama-3-8b-japanese · How It Works · Data refreshed daily, snapshot 2026-09-19.