ELYZA-japanese-Llama-2-13B-instruct: benchmark results

Provider: Other. Access: Open.

Unified ELO 1411 ± 20, rank #2051 of 2928 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - HellaSwag82.2Normalized accuracy (%) (10-shot)49.5
Open LLM Leaderboard v1 - WinoGrande75.22Accuracy (%) (5-shot)41
Open LLM Leaderboard v1 - ARC Challenge58.36Normalized accuracy (%) (25-shot)39.6
Open LLM Leaderboard v1 - MMLU55.65Accuracy (%) (5-shot)36.9
Open LLM Leaderboard v1 - GSM8K14.48Accuracy (%) (5-shot)36.4
pfgen-bench - QA Mode - Helpfulness0.09Helpfulness Score31.2
pfgen-bench - QA Mode - Truthfulness0.65Truthfulness Score30.9
pfgen-bench - QA Mode - Score0.41pfgen Score (mean of three)30.3
pfgen-bench - QA Mode - Fluency0.49Fluency Score29.7
Open LLM Leaderboard v1 - TruthfulQA MC242.4MC2 (%) (0-shot)20.4

Interactive version: theaggregate.ai/model?slug=elyza-japanese-llama-2-13b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-23.