NeuralDaredevil-8B-abliterated — benchmark results

mlabonne's abliterated Daredevil-8B Llama 3 merge, DPO-tuned on orpo-dpo-mix-40k to recover the performance lost to abliteration. Provider: Other. Released 2024-05-27. Access: Open.

Unified ELO 1464 ± 17, rank #937 of 1776 rated models, from 23 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval75.61Score91.2
Open Chinese LLM - GSM8K53.83Accuracy (%)73.1
Open LLM Leaderboard - MMLU-Pro31.57Score67.8
Open Chinese LLM Leaderboard58.97Average Score (%)67.1
Open PL LLM - Generative58.22Average Generative Score (%)66.8
Open PL LLM Leaderboard53.66Average Score (%)65
Open Chinese LLM - TruthfulQA MC55.72Accuracy (%)64.4
Open Chinese LLM - ARC Challenge54.18Accuracy (%)63.9
Open LLM Leaderboard - GPQA7.49Score63.1
Open PL LLM - Multiple Choice47.73Average Multiple-Choice Score (%)62.6
Open PL LLM - RAG61.92Average RAG Score (%)62.2
UGI - Willingness (W/10)6.5W/10 Score62.1

Interactive version: theaggregate.ai/model?slug=neuraldaredevil-8b-abliterated · How the rankings work · Data refreshed daily, snapshot 2026-07-22.