Hermes 4 70B — benchmark results

Nous Research's Hermes 4 hybrid-reasoning fine-tune of Llama 3.1 70B with toggleable think traces (August 2025). Provider: Nous Research. Released 2025-08-26. Access: Open.

Unified ELO 1575 ± 15, rank #547 of 1776 rated models, from 106 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - story_quality1.24Dataset z-score96.3
AGC-Bench - twistlist1.56Dataset z-score96.3
AGC-Bench - futuregen1.33Dataset z-score95
AGC-Bench - science_analogies2Dataset z-score95
Medmarks - MedHallu Hard52Score (%)91.4
AGC-Bench - historical_analogy1.41Dataset z-score91.2
AGC-Bench - lcc_metaphor1.02Dataset z-score85.2
AGC-Bench - creatset1.22Dataset z-score84.1
Medmarks - MedHallu Easy69.19Score (%)80
SpeechMap Compliance83.7% Requests Completed79.1
Medmarks - PubHealthBench Reviewed86.32Score (%)78.6
UGI - Writing41.57Writing Score78.6

Interactive version: theaggregate.ai/model?slug=hermes-4-70b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.