Nous-Hermes-2-Mixtral-8x7B-DPO — benchmark results

Nous Research's SFT+DPO Mixtral 8x7B fine-tune (January 2024), its then-flagship trained on ~1M mostly GPT-4-generated examples. Provider: Nous Research. Released 2024-01-11. Access: Open.

Unified ELO 1433 ± 15, rank #1076 of 1776 rated models, from 24 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR16.68Score86.4
BiGGen-Bench3.74Average Score (1-5)80.4
Open LLM Leaderboard - BBH37.11Score76.6
Open LLM Leaderboard - GPQA9.51Score76
BenchBench70.94Aggregate Score (%)73.5
Open LLM Leaderboard - IFEval58.97Score70.7
Open Chinese LLM Leaderboard58.55Average Score (%)65.3
Open Chinese LLM - GSM8K49.13Accuracy (%)64.5
Open Chinese LLM - TruthfulQA MC55.17Accuracy (%)61.9
Open Chinese LLM - C-Eval Semantic73Accuracy (%)60.8
Open Chinese LLM - CMMLU55.94Accuracy (%)60.2
Open Chinese LLM - WinoGrande63.69Accuracy (%)59.9

Interactive version: theaggregate.ai/model?slug=nous-hermes-2-mixtral-8x7b-dpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.