ELYZA-japanese-Llama-2-13B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1411 ± 20, rank #2050 of 2928 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - WinoGrande76.87Accuracy (%) (5-shot)51.3
Open LLM Leaderboard v1 - GSM8K27.29Accuracy (%) (5-shot)45.2
Open LLM Leaderboard v1 - HellaSwag80.89Normalized accuracy (%) (10-shot)42.7
Open LLM Leaderboard v1 - ARC Challenge57Normalized accuracy (%) (25-shot)36.5
Open LLM Leaderboard v1 - MMLU54.38Accuracy (%) (5-shot)33.9
pfgen-bench - Completion Mode - Fluency0.49Fluency Score33.9
pfgen-bench - Completion Mode - Truthfulness0.63Truthfulness Score33.2
pfgen-bench - Completion Mode - Helpfulness0.07Helpfulness Score32.9
pfgen-bench - Completion Mode - Score0.4pfgen Score (mean of three)31.6
Open LLM Leaderboard v1 - TruthfulQA MC240.43MC2 (%) (0-shot)14.2

Interactive version: theaggregate.ai/model?slug=elyza-japanese-llama-2-13b · How It Works · Data refreshed daily, snapshot 2026-09-23.