Nous-Hermes-2-Mixtral-8x7B-DPO — benchmark results
Nous Research's SFT+DPO Mixtral 8x7B fine-tune (January 2024), its then-flagship trained on ~1M mostly GPT-4-generated examples. Provider: Nous Research. Released 2024-01-11. Access: Open.
Unified ELO 1433 ± 15, rank #1076 of 1776 rated models, from 24 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MuSR | 16.68 | Score | 86.4 |
| BiGGen-Bench | 3.74 | Average Score (1-5) | 80.4 |
| Open LLM Leaderboard - BBH | 37.11 | Score | 76.6 |
| Open LLM Leaderboard - GPQA | 9.51 | Score | 76 |
| BenchBench | 70.94 | Aggregate Score (%) | 73.5 |
| Open LLM Leaderboard - IFEval | 58.97 | Score | 70.7 |
| Open Chinese LLM Leaderboard | 58.55 | Average Score (%) | 65.3 |
| Open Chinese LLM - GSM8K | 49.13 | Accuracy (%) | 64.5 |
| Open Chinese LLM - TruthfulQA MC | 55.17 | Accuracy (%) | 61.9 |
| Open Chinese LLM - C-Eval Semantic | 73 | Accuracy (%) | 60.8 |
| Open Chinese LLM - CMMLU | 55.94 | Accuracy (%) | 60.2 |
| Open Chinese LLM - WinoGrande | 63.69 | Accuracy (%) | 59.9 |
Interactive version: theaggregate.ai/model?slug=nous-hermes-2-mixtral-8x7b-dpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.