Nous-Hermes-2-Mistral-7B-DPO — benchmark results
Provider: Nous Research. Released 2024-01-15. Access: Open.
Unified ELO 1384 ± 18, rank #1295 of 1776 rated models, from 32 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - IFEval | 57.63 | Score | 69.5 |
| RewardBench | 74.81 | Score (%) | 68.5 |
| Open Medical LLM - PubMedQA | 74.8 | Accuracy (%) | 66.2 |
| BiGGen-Bench | 3.49 | Average Score (1-5) | 60.8 |
| LogicKor - Reasoning | 6 | Score (0-10) | 56.2 |
| RewardBench Safety | 82.43 | Accuracy (%) | 55.9 |
| RewardBench Chat Hard | 60.53 | Accuracy (%) | 48.6 |
| Open LLM Leaderboard - GPQA | 5.7 | Score | 47.8 |
| LogicKor - Coding | 7 | Score (0-10) | 46.2 |
| LogicKor - Multi-Turn | 5.57 | Score (0-10) | 46 |
| Open Medical LLM - MedQA (USMLE) | 53.1 | Accuracy (%) | 45.7 |
| LogicKor - Writing | 6.92 | Score (0-10) | 44.5 |
Interactive version: theaggregate.ai/model?slug=nous-hermes-2-mistral-7b-dpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.