DeepHermes-3-Mistral-24B-Preview — benchmark results
Nous Research's DeepHermes 3 preview on Mistral Small 24B, toggling between plain chat and long R1-distilled reasoning via system prompt (March 2025). Provider: Nous Research. Released 2025-03-02. Access: Open.
Unified ELO 1522 ± 40, rank #716 of 1776 rated models, from 7 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - GPQA | 16 | Score | 92.5 |
| Open LLM Leaderboard - BBH | 48.96 | Score | 89.5 |
| Open LLM Leaderboard - MMLU-Pro | 39.89 | Score | 84.9 |
| Open LLM Leaderboard - MuSR | 15.96 | Score | 84.5 |
| Open LLM Leaderboard - MATH Level 5 | 25.76 | Score | 78.7 |
| Open LLM Leaderboard - IFEval | 45.36 | Score | 50.2 |
| SnakeBench | 13.3 | TrueSkill Rating | 11.2 |
Interactive version: theaggregate.ai/model?slug=deephermes-3-mistral-24b-preview · How the rankings work · Data refreshed daily, snapshot 2026-07-22.