dolphin-2.9.2-Phi-3-Medium-abliterated — benchmark results

Cognitive Computations' Dolphin 2.9.2 tune of Phi-3 Medium 14B with refusals further ablated by FailSpy, for uncensored instruction, chat, and coding use. Provider: Cognitive Computations. Released 2024-06-03. Access: Open.

Unified ELO 1427 ± 22, rank #1097 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - BBH48.39Score88.5
Open LLM Leaderboard - MMLU-Pro39.16Score84.2
Open LLM Leaderboard - GPQA10.51Score80.1
Open Chinese LLM - GSM8K56.33Accuracy (%)77.9
Open LLM Leaderboard - MuSR13.73Score75.5
Open LLM Leaderboard - MATH Level 518.2Score67.8
Open Chinese LLM - C-Eval Semantic78.18Accuracy (%)67.7
Open Chinese LLM Leaderboard59.12Average Score (%)67.4
Open Chinese LLM - CMMLU58.03Accuracy (%)65.6
Open Korean LLM Leaderboard239.14Average Score (%)61.7
Open Chinese LLM - WinoGrande63.61Accuracy (%)59.2
Open Chinese LLM - ARC Challenge51.28Accuracy (%)45.7

Interactive version: theaggregate.ai/model?slug=dolphin-2-9-2-phi-3-medium-abliterated · How the rankings work · Data refreshed daily, snapshot 2026-07-22.