Hermes 4 405B (Thinking): benchmark results

Provider: Nous Research. Released 2025-08-26. Access: Open.

Unified ELO 1556 ± 1, rank #610 of 1761 rated models, from 37 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
SpeechMap Compliance89.7% Requests Completed90.5
AA Omniscience - Software Engineering (SWE) - R26Accuracy (%)85.5
AA Omniscience - Software Engineering (SWE) - Julia28Accuracy (%)85.2
AA Omniscience - Software Engineering (SWE) - HTML46Accuracy (%)83.1
AA Omniscience - Software Engineering (SWE) - Swift48Accuracy (%)82.4
CritPt30Accuracy (self-reported)80.8
AA MMLU-Pro82.9Accuracy (%)80.7
AA Omniscience - Software Engineering (SWE) - C49Accuracy (%)79.9
AA Omniscience - Humanities & Social Sciences31.7Accuracy (%)77.5
AA Omniscience - Health31.6Accuracy (%)77
AA Omniscience - Business26.1Accuracy (%)76
AA Omniscience - Law24.3Accuracy (%)75.9

Interactive version: theaggregate.ai/model?slug=hermes-4-405b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.