Nous-Hermes-2-Mistral-7B-DPO: benchmark results
Provider: Nous Research. Released 2024-01-15. Access: Open.
Unified ELO 1428 ± 1, rank #1038 of 1392 rated models, from 32 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - IFEval | 57.63 | Score | 69.5 |
| RewardBench | 74.81 | Score (%) | 68.5 |
| Open Medical LLM - PubMedQA | 74.8 | Accuracy (%) | 66.2 |
| BiGGen-Bench | 3.49 | Average Score (1-5) | 60.8 |
| RewardBench Safety | 82.43 | Accuracy (%) | 55.9 |
| LogicKor - Reasoning | 6 | Score (0-10) | 53.8 |
| RewardBench Chat Hard | 60.53 | Accuracy (%) | 48.6 |
| Open LLM Leaderboard - GPQA | 5.7 | Score | 47.8 |
| Open Medical LLM - MedQA (USMLE) | 53.1 | Accuracy (%) | 45.7 |
| Open LLM Leaderboard - BBH | 27.79 | Score | 44.5 |
| LogicKor - Coding | 7 | Score (0-10) | 43.9 |
| Open Medical LLM - MedMCQA | 49.01 | Accuracy (%) | 43.8 |
Interactive version: theaggregate.ai/model?slug=nous-hermes-2-mistral-7b-dpo · How It Works · Data refreshed daily, snapshot 2026-09-05.