NeuralDaredevil-8B-abliterated — benchmark results
mlabonne's abliterated Daredevil-8B Llama 3 merge, DPO-tuned on orpo-dpo-mix-40k to recover the performance lost to abliteration. Provider: Other. Released 2024-05-27. Access: Open.
Unified ELO 1464 ± 17, rank #937 of 1776 rated models, from 23 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - IFEval | 75.61 | Score | 91.2 |
| Open Chinese LLM - GSM8K | 53.83 | Accuracy (%) | 73.1 |
| Open LLM Leaderboard - MMLU-Pro | 31.57 | Score | 67.8 |
| Open Chinese LLM Leaderboard | 58.97 | Average Score (%) | 67.1 |
| Open PL LLM - Generative | 58.22 | Average Generative Score (%) | 66.8 |
| Open PL LLM Leaderboard | 53.66 | Average Score (%) | 65 |
| Open Chinese LLM - TruthfulQA MC | 55.72 | Accuracy (%) | 64.4 |
| Open Chinese LLM - ARC Challenge | 54.18 | Accuracy (%) | 63.9 |
| Open LLM Leaderboard - GPQA | 7.49 | Score | 63.1 |
| Open PL LLM - Multiple Choice | 47.73 | Average Multiple-Choice Score (%) | 62.6 |
| Open PL LLM - RAG | 61.92 | Average RAG Score (%) | 62.2 |
| UGI - Willingness (W/10) | 6.5 | W/10 Score | 62.1 |
Interactive version: theaggregate.ai/model?slug=neuraldaredevil-8b-abliterated · How the rankings work · Data refreshed daily, snapshot 2026-07-22.