Hermes 4 405B — benchmark results

Nous Research's Hermes 4 open hybrid-reasoning fine-tune of Llama 3.1 405B. Provider: Nous Research. Released 2025-08-26. Access: Open.

Unified ELO 1648 ± 22, rank #373 of 1776 rated models, from 84 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - proparalogy0.94Dataset z-score98.8
AGC-Bench - science_analogies2.45Dataset z-score98.8
AGC-Bench - story_quality1.31Dataset z-score98.8
AGC-Bench - hypobench0.43Dataset z-score97.6
AGC-Bench - Problem Solving0.73JRT z-score96.3
AGC-Bench - ocw_connections1.11Dataset z-score96.3
AGC-Bench - schnovel1.56Dataset z-score95.7
UGI Leaderboard54.07UGI Score95.6
AGC-Bench - metaphoric_analogies2.18Dataset z-score95.1
Diplomacy: Betrayal Tendency91.7Betrayal Rate (%)93.8
AGC-Bench - historical_analogy1.41Dataset z-score91.2
AGC-Bench - riddlesense0.98Dataset z-score88.8

Interactive version: theaggregate.ai/model?slug=hermes-4-405b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.