Dolphin3.0-R1-Mistral-24B — benchmark results

Provider: Cognitive Computations. Released 2025-02-06. Access: Open.

Unified ELO 1379 ± 10, rank #1316 of 1776 rated models, from 179 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MATH Level 531.19Score82.6
Open LLM Leaderboard - BBH33.76Score66.3
Open Arabic LLM - Arabic MMLU HT Abstract Algebra29Accuracy (%)54.9
Open Arabic LLM - Arabic MMLU LAW (Professional)63.38Accuracy (%)50.9
Open LLM Leaderboard - GPQA5.93Score49.7
Open Japanese LLM - CG7.83Score (%)47.8
Open Japanese LLM - Jamp Exact Match58.33Score (%)43.5
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Xglue Mlqa Task70.67Accuracy (%)42
Open Japanese LLM - Mbpp Pylint Check13.05Score (%)41.3
Open LLM Leaderboard - IFEval40.68Score40.8
Open Japanese LLM - Wiki NER SET F13.54Score (%)39.4
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task70Accuracy (%)38

Interactive version: theaggregate.ai/model?slug=dolphin3-0-r1-mistral-24b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.