NeuralLLaMa-3-8B-ORPO-v0.4: benchmark results

Provider: Other. Released 2024-05-16. Access: Open.

Unified ELO 1466 ± 1, rank #870 of 1392 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard39.62Average Score (%)69.4
Open Chinese LLM - GSM8K48.9Accuracy (%)63.4
Open Chinese LLM - TruthfulQA MC54.83Accuracy (%)58.5
Open Chinese LLM - WinoGrande63.38Accuracy (%)55.8
Open Chinese LLM - CMMLU54.23Accuracy (%)54.9
Open Chinese LLM - C-Eval Semantic69.38Accuracy (%)49.9
Open Chinese LLM Leaderboard56.46Average Score (%)47.6
Open Chinese LLM - ARC Challenge48.21Accuracy (%)33.4
Open Chinese LLM - HellaSwag56.29Accuracy (%)29.4

Interactive version: theaggregate.ai/model?slug=neuralllama-3-8b-orpo-v0-4 · How It Works · Data refreshed daily, snapshot 2026-09-05.