Hermes 4 70B: benchmark results

Nous Research's Hermes 4 hybrid-reasoning fine-tune of Llama 3.1 70B with toggleable think traces (August 2025). Provider: Nous Research. Released 2025-08-26. Access: Open.

Unified ELO 1542 ± 1, rank #473 of 1392 rated models, from 107 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - story_quality1.24Dataset z-score96.3
AGC-Bench - twistlist1.56Dataset z-score96.3
AGC-Bench - futuregen1.33Dataset z-score95
AGC-Bench - science_analogies2Dataset z-score95
Medmarks - MedHallu Hard52Score (%)91.4
AGC-Bench - historical_analogy1.41Dataset z-score91.2
AGC-Bench - lcc_metaphor1.02Dataset z-score85.2
AGC-Bench - creatset1.22Dataset z-score84.1
SpeechMap Compliance83.7% Requests Completed80.7
Medmarks - MedHallu Easy69.19Score (%)80
Medmarks - PubHealthBench Reviewed86.32Score (%)78.6
AGC-Bench - metaphoric_analogies0.44Dataset z-score78

Interactive version: theaggregate.ai/model?slug=hermes-4-70b · How It Works · Data refreshed daily, snapshot 2026-09-05.