japanese-gpt-neox-3.6B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1185 ± 21, rank #2919 of 2928 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - TruthfulQA MC251.45MC2 (%) (0-shot)52
pfgen-bench - Completion Mode - Helpfulness0.11Helpfulness Score48.1
pfgen-bench - Completion Mode - Truthfulness0.69Truthfulness Score42.8
pfgen-bench - Completion Mode - Score0.43pfgen Score (mean of three)39.9
pfgen-bench - Completion Mode - Fluency0.49Fluency Score31.3
Open LLM Leaderboard v1 - GSM8K0Accuracy (%) (5-shot)4.6
Open LLM Leaderboard v1 - ARC Challenge25Normalized accuracy (%) (25-shot)4.4
Open LLM Leaderboard v1 - WinoGrande50.67Accuracy (%) (5-shot)4.1
Open LLM Leaderboard v1 - HellaSwag25.46Normalized accuracy (%) (10-shot)1.1
Open LLM Leaderboard v1 - MMLU23.12Accuracy (%) (5-shot)1

Interactive version: theaggregate.ai/model?slug=japanese-gpt-neox-3-6b · How It Works · Data refreshed daily, snapshot 2026-09-23.