Nous-Hermes-13B: benchmark results

Provider: Nous Research. Access: Open.

Unified ELO 1370 ± 10, rank #2349 of 2928 rated models, from 77 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MMLU-by-task - Global Facts40Accuracy (%)88.6
MMLU-by-task - Formal Logic38.89Accuracy (%)83.9
MMLU-by-task - TruthfulQA MC251.5Accuracy (%)83
MMLU-by-task - TruthfulQA MC135.37Accuracy (%)82.5
MMLU-by-task - Human Sexuality63.36Accuracy (%)76.3
MMLU-by-task - HellaSwag62.22Accuracy (%)75
MMLU-by-task - Machine Learning37.5Accuracy (%)71.9
MMLU-by-task - Management71.84Accuracy (%)71.8
MMLU-by-task - US Foreign Policy79Accuracy (%)69.9
MMLU-by-task - ARC Challenge54.95Accuracy (%)69
MMLU-by-task - Sociology71.14Accuracy (%)68.9
MMLU-by-task - Professional Psychology52.78Accuracy (%)67.5

Interactive version: theaggregate.ai/model?slug=nous-hermes-13b · How It Works · Data refreshed daily, snapshot 2026-09-23.