Hermes 4 405B: benchmark results

Nous Research's Hermes 4 open hybrid-reasoning fine-tune of Llama 3.1 405B. Provider: Nous Research. Released 2025-08-26. Access: Open.

Unified ELO 1572 ± 1, rank #353 of 1392 rated models, from 84 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - proparalogy0.94Dataset z-score98.8
AGC-Bench - science_analogies2.45Dataset z-score98.8
AGC-Bench - story_quality1.31Dataset z-score98.8
AGC-Bench - hypobench0.43Dataset z-score97.6
AGC-Bench - Problem Solving0.73JRT z-score96.3
AGC-Bench - ocw_connections1.11Dataset z-score96.3
AGC-Bench - schnovel1.56Dataset z-score95.7
UGI Leaderboard54.07UGI Score95.5
AGC-Bench - metaphoric_analogies2.18Dataset z-score95.1
AGC-Bench - historical_analogy1.41Dataset z-score91.2
AGC-Bench - riddlesense0.98Dataset z-score88.8
AGC-Bench - creatset1.37Dataset z-score87.8

Interactive version: theaggregate.ai/model?slug=hermes-4-405b · How It Works · Data refreshed daily, snapshot 2026-09-05.