dolphin-2.9.2-Phi-3 (Medium) — benchmark results

Cognitive Computations' Dolphin 2.9.2 fine-tune of Phi-3 Medium 14B for instruction, chat, coding, and function calling, with alignment data filtered out. Provider: Cognitive Computations. Released 2024-05-31. Access: Open.

Unified ELO 1427 ± 21, rank #1098 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - BBH49.72Score91.1
Open LLM Leaderboard - MMLU-Pro39.5Score84.5
Open Chinese LLM - GSM8K57.92Accuracy (%)80.4
Open LLM Leaderboard - GPQA10.29Score79.2
Open Chinese LLM Leaderboard59.66Average Score (%)68.8
Open Chinese LLM - C-Eval Semantic78.97Accuracy (%)68.2
Open LLM Leaderboard - MATH Level 518.28Score68
Open Chinese LLM - CMMLU58.76Accuracy (%)66.5
Open Chinese LLM - WinoGrande64.17Accuracy (%)65
Open Korean LLM Leaderboard245.22Average Score (%)62.3
Open LLM Leaderboard - MuSR11.41Score59.8
Open Chinese LLM - ARC Challenge51.19Accuracy (%)45.4

Interactive version: theaggregate.ai/model?slug=dolphin-2-9-2-phi-3-medium · How the rankings work · Data refreshed daily, snapshot 2026-07-22.