DeepHermes-3-Mistral-24B-Preview — benchmark results

Nous Research's DeepHermes 3 preview on Mistral Small 24B, toggling between plain chat and long R1-distilled reasoning via system prompt (March 2025). Provider: Nous Research. Released 2025-03-02. Access: Open.

Unified ELO 1522 ± 40, rank #716 of 1776 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - GPQA16Score92.5
Open LLM Leaderboard - BBH48.96Score89.5
Open LLM Leaderboard - MMLU-Pro39.89Score84.9
Open LLM Leaderboard - MuSR15.96Score84.5
Open LLM Leaderboard - MATH Level 525.76Score78.7
Open LLM Leaderboard - IFEval45.36Score50.2
SnakeBench13.3TrueSkill Rating11.2

Interactive version: theaggregate.ai/model?slug=deephermes-3-mistral-24b-preview · How the rankings work · Data refreshed daily, snapshot 2026-07-22.