Hermes 4 70B — benchmark results
Nous Research's Hermes 4 hybrid-reasoning fine-tune of Llama 3.1 70B with toggleable think traces (August 2025). Provider: Nous Research. Released 2025-08-26. Access: Open.
Unified ELO 1575 ± 15, rank #547 of 1776 rated models, from 106 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AGC-Bench - story_quality | 1.24 | Dataset z-score | 96.3 |
| AGC-Bench - twistlist | 1.56 | Dataset z-score | 96.3 |
| AGC-Bench - futuregen | 1.33 | Dataset z-score | 95 |
| AGC-Bench - science_analogies | 2 | Dataset z-score | 95 |
| Medmarks - MedHallu Hard | 52 | Score (%) | 91.4 |
| AGC-Bench - historical_analogy | 1.41 | Dataset z-score | 91.2 |
| AGC-Bench - lcc_metaphor | 1.02 | Dataset z-score | 85.2 |
| AGC-Bench - creatset | 1.22 | Dataset z-score | 84.1 |
| Medmarks - MedHallu Easy | 69.19 | Score (%) | 80 |
| SpeechMap Compliance | 83.7 | % Requests Completed | 79.1 |
| Medmarks - PubHealthBench Reviewed | 86.32 | Score (%) | 78.6 |
| UGI - Writing | 41.57 | Writing Score | 78.6 |
Interactive version: theaggregate.ai/model?slug=hermes-4-70b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.