Hermes-3-Llama-3.1-405B: benchmark results
Provider: Nous Research. Released 2024-08-13. Access: Open.
Unified ELO 1643 ± 25, rank #479 of 2656 rated models, from 92 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AgentDrive - Physics | 57.5 | Accuracy (%) | 95 |
| AGC-Bench - proparalogy | 0.86 | Dataset z-score | 93.2 |
| AGC-Bench - science_analogies | 1.58 | Dataset z-score | 92.5 |
| AGC-Bench - puntuguese | 0.94 | Dataset z-score | 91.5 |
| AGC-Bench - sdat | 0.61 | Dataset z-score | 91.4 |
| AGC-Bench - story_quality | 1.13 | Dataset z-score | 91.4 |
| AGC-Bench - permpst | 1.26 | Dataset z-score | 90.2 |
| UGI - Natural Intelligence | 43.48 | NatInt Score | 87.4 |
| AGC-Bench - meta4xnli | 0.78 | Dataset z-score | 87.2 |
| AGC-Bench - ocw_connections | 1.01 | Dataset z-score | 86.6 |
| AGC-Bench - story_generation_rocstories | 0.89 | Dataset z-score | 85.4 |
| UGI Leaderboard | 47.27 | UGI Score | 84.1 |
Interactive version: theaggregate.ai/model?slug=hermes-3-llama-3-1-405b · How It Works · Data refreshed daily, snapshot 2026-09-19.