bilingual-gpt-neox-4B-instruction-sft: benchmark results

Provider: Other. Access: Open.

Unified ELO 1191 ± 20, rank #2915 of 2928 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
pfgen-bench - Completion Mode - Truthfulness0.65Truthfulness Score37.7
pfgen-bench - Completion Mode - Score0.38pfgen Score (mean of three)29.7
pfgen-bench - Completion Mode - Fluency0.46Fluency Score27
Open LLM Leaderboard v1 - TruthfulQA MC243.76MC2 (%) (0-shot)24.7
pfgen-bench - Completion Mode - Helpfulness0.04Helpfulness Score23
Open LLM Leaderboard v1 - HellaSwag47.5Normalized accuracy (%) (10-shot)9.6
Open LLM Leaderboard v1 - ARC Challenge28.07Normalized accuracy (%) (25-shot)7.3
Open LLM Leaderboard v1 - WinoGrande52.33Accuracy (%) (5-shot)6.7
Open LLM Leaderboard v1 - GSM8K0Accuracy (%) (5-shot)4.6
Open LLM Leaderboard v1 - MMLU23.12Accuracy (%) (5-shot)1

Interactive version: theaggregate.ai/model?slug=bilingual-gpt-neox-4b-instruction-sft · How It Works · Data refreshed daily, snapshot 2026-09-23.