NeuralDaredevil-8B-abliterated: benchmark results

mlabonne's abliterated Daredevil-8B Llama 3 merge, DPO-tuned on orpo-dpo-mix-40k to recover the performance lost to abliteration. Provider: Other. Released 2024-05-27. Access: Open.

Unified ELO 1494 ± 1, rank #719 of 1392 rated models, from 23 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval75.61Score91.2
Open Chinese LLM - GSM8K53.83Accuracy (%)73.1
Open LLM Leaderboard - MMLU-Pro31.57Score67.7
Open Chinese LLM Leaderboard58.97Average Score (%)67.1
Open PL LLM - Generative58.22Average Generative Score (%)66.8
Open PL LLM Leaderboard53.66Average Score (%)65
Open Chinese LLM - TruthfulQA MC55.72Accuracy (%)64.4
Open Chinese LLM - ARC Challenge54.18Accuracy (%)63.9
Open LLM Leaderboard - GPQA7.49Score63.2
Open PL LLM - Multiple Choice47.73Average Multiple-Choice Score (%)62.6
UGI - Willingness (W/10)6.5W/10 Score62.5
Open PL LLM - RAG61.92Average RAG Score (%)62.2

Interactive version: theaggregate.ai/model?slug=neuraldaredevil-8b-abliterated · How It Works · Data refreshed daily, snapshot 2026-09-05.