bilingual-gpt-neox-4B-instruction-ppo: benchmark results

Provider: Other. Access: Open.

Unified ELO 1192 ± 20, rank #2911 of 2928 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
pfgen-bench - Completion Mode - Truthfulness0.77Truthfulness Score58.5
pfgen-bench - Completion Mode - Score0.44pfgen Score (mean of three)43.1
pfgen-bench - Completion Mode - Fluency0.49Fluency Score33.9
pfgen-bench - Completion Mode - Helpfulness0.06Helpfulness Score28.9
Open LLM Leaderboard v1 - TruthfulQA MC243.5MC2 (%) (0-shot)23.7
Open LLM Leaderboard v1 - HellaSwag47.9Normalized accuracy (%) (10-shot)9.8
Open LLM Leaderboard v1 - ARC Challenge28.24Normalized accuracy (%) (25-shot)7.5
Open LLM Leaderboard v1 - WinoGrande52.25Accuracy (%) (5-shot)6.6
Open LLM Leaderboard v1 - GSM8K0Accuracy (%) (5-shot)4.6
Open LLM Leaderboard v1 - MMLU23.12Accuracy (%) (5-shot)1

Interactive version: theaggregate.ai/model?slug=bilingual-gpt-neox-4b-instruction-ppo · How It Works · Data refreshed daily, snapshot 2026-09-23.