Dolphin3.0-R1-Mistral-24B — benchmark results
Provider: Cognitive Computations. Released 2025-02-06. Access: Open.
Unified ELO 1379 ± 10, rank #1316 of 1776 rated models, from 179 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MATH Level 5 | 31.19 | Score | 82.6 |
| Open LLM Leaderboard - BBH | 33.76 | Score | 66.3 |
| Open Arabic LLM - Arabic MMLU HT Abstract Algebra | 29 | Accuracy (%) | 54.9 |
| Open Arabic LLM - Arabic MMLU LAW (Professional) | 63.38 | Accuracy (%) | 50.9 |
| Open LLM Leaderboard - GPQA | 5.93 | Score | 49.7 |
| Open Japanese LLM - CG | 7.83 | Score (%) | 47.8 |
| Open Japanese LLM - Jamp Exact Match | 58.33 | Score (%) | 43.5 |
| Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Xglue Mlqa Task | 70.67 | Accuracy (%) | 42 |
| Open Japanese LLM - Mbpp Pylint Check | 13.05 | Score (%) | 41.3 |
| Open LLM Leaderboard - IFEval | 40.68 | Score | 40.8 |
| Open Japanese LLM - Wiki NER SET F1 | 3.54 | Score (%) | 39.4 |
| Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task | 70 | Accuracy (%) | 38 |
Interactive version: theaggregate.ai/model?slug=dolphin3-0-r1-mistral-24b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.