Nous-Hermes-llama-2-7B — benchmark results
Provider: Nous Research. Released 2023-07-25. Access: Open.
Unified ELO 1242 ± 13, rank #1634 of 1776 rated models, from 75 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MMLU-by-task - Business Ethics | 57 | Accuracy (%) | 81 |
| MMLU-by-task - Professional Medicine | 54.41 | Accuracy (%) | 78 |
| MMLU-by-task - Electrical Engineering | 49.66 | Accuracy (%) | 73.9 |
| MMLU-by-task - TruthfulQA MC1 | 33.41 | Accuracy (%) | 72.8 |
| MMLU-by-task - Machine Learning | 37.5 | Accuracy (%) | 71.9 |
| MMLU-by-task - TruthfulQA MC2 | 49.01 | Accuracy (%) | 71.4 |
| MMLU-by-task - Abstract Algebra | 32 | Accuracy (%) | 68.1 |
| MMLU-by-task - College Computer Science | 44 | Accuracy (%) | 67.5 |
| MMLU-by-task - College Medicine | 45.66 | Accuracy (%) | 63.5 |
| MMLU-by-task - Human Aging | 59.64 | Accuracy (%) | 63.5 |
| MMLU-by-task - Philosophy | 59.49 | Accuracy (%) | 63.5 |
| Open CoT - LSAT Analytical Reasoning | 4.78 | CoT Gain (%) | 63 |
Interactive version: theaggregate.ai/model?slug=nous-hermes-llama-2-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.