NeuralLLaMa-3-8B-ORPO-v0.4 — benchmark results

Provider: Other. Released 2024-05-16. Access: Open.

Unified ELO 1389 ± 18, rank #1272 of 1776 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - GSM8K48.9Accuracy (%)63.4
Open Chinese LLM - TruthfulQA MC54.83Accuracy (%)58.5
Open Korean LLM Leaderboard194.37Average Score (%)58.5
Open Chinese LLM - WinoGrande63.38Accuracy (%)55.8
Open Chinese LLM - CMMLU54.23Accuracy (%)54.9
Open Chinese LLM - C-Eval Semantic69.38Accuracy (%)49.9
Open Chinese LLM Leaderboard56.46Average Score (%)47.6
Open Chinese LLM - ARC Challenge48.21Accuracy (%)33.4
Open Chinese LLM - HellaSwag56.29Accuracy (%)29.4

Interactive version: theaggregate.ai/model?slug=neuralllama-3-8b-orpo-v0-4 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.