dolphin-2.9.2-Phi-3-Medium-abliterated: benchmark results

Cognitive Computations' Dolphin 2.9.2 tune of Phi-3 Medium 14B with refusals further ablated by FailSpy, for uncensored instruction, chat, and coding use. Provider: Cognitive Computations. Released 2024-06-03. Access: Open.

Unified ELO 1471 ± 1, rank #835 of 1392 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - BBH48.39Score88.5
Open LLM Leaderboard - MMLU-Pro39.16Score84.2
Open LLM Leaderboard - GPQA10.51Score80.1
Open Chinese LLM - GSM8K56.33Accuracy (%)77.9
Open LLM Leaderboard - MuSR13.73Score75.5
Open LLM Leaderboard - MATH Level 518.2Score67.8
Open Chinese LLM - C-Eval Semantic78.18Accuracy (%)67.7
Open Chinese LLM Leaderboard59.12Average Score (%)67.4
Open Chinese LLM - CMMLU58.03Accuracy (%)65.6
Open Chinese LLM - WinoGrande63.61Accuracy (%)59.2
Open Korean LLM Leaderboard36.04Average Score (%)52.2
Open Chinese LLM - ARC Challenge51.28Accuracy (%)45.7

Interactive version: theaggregate.ai/model?slug=dolphin-2-9-2-phi-3-medium-abliterated · How It Works · Data refreshed daily, snapshot 2026-09-05.