dolphin-2.6-mixtral-8x7B — benchmark results

Provider: Cognitive Computations. Released 2023-12-21. Access: Open.

Unified ELO 1338 ± 10, rank #1447 of 1776 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EvalPlus (HumanEval+ & MBPP+)58.1Pass@1 avg (%)54.8
Open Chinese LLM - CMMLU50.47Accuracy (%)36.5
Open Chinese LLM - C-Eval Semantic58.56Accuracy (%)19.9
Open Chinese LLM - GSM8K23.88Accuracy (%)17.4
Open Chinese LLM - WinoGrande59.98Accuracy (%)13.6
Open Chinese LLM - TruthfulQA MC47.72Accuracy (%)11
Open Chinese LLM Leaderboard47.26Average Score (%)10.4
Open Chinese LLM - ARC Challenge41.04Accuracy (%)8.3
Open Chinese LLM - HellaSwag49.17Accuracy (%)7.1

Interactive version: theaggregate.ai/model?slug=dolphin-2-6-mixtral-8x7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.