Nous-Hermes-2-Mixtral-8x7B-DPO: benchmark results

Nous Research's SFT+DPO Mixtral 8x7B fine-tune (January 2024), its then-flagship trained on ~1M mostly GPT-4-generated examples. Provider: Nous Research. Released 2024-01-11. Access: Open.

Unified ELO 1430 ± 1, rank #1030 of 1392 rated models, from 38 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR16.68Score86.4
BiGGen-Bench3.74Average Score (1-5)80.4
Open LLM Leaderboard - BBH37.11Score76.6
Open LLM Leaderboard - GPQA9.51Score76
BenchBench70.94Aggregate Score (%)73.5
Open LLM Leaderboard - IFEval58.97Score70.7
Open Chinese LLM Leaderboard58.55Average Score (%)65.3
Open Chinese LLM - GSM8K49.13Accuracy (%)64.5
Open Chinese LLM - TruthfulQA MC55.17Accuracy (%)61.9
Open Chinese LLM - C-Eval Semantic73Accuracy (%)60.8
Open Chinese LLM - CMMLU55.94Accuracy (%)60.2
Open Chinese LLM - WinoGrande63.69Accuracy (%)59.9

Interactive version: theaggregate.ai/model?slug=nous-hermes-2-mixtral-8x7b-dpo · How It Works · Data refreshed daily, snapshot 2026-09-05.