Hermes 3 - Llama-3.1 70B — benchmark results

Provider: Nous Research. Released 2024-08-16. Access: Open.

Unified ELO 1236 ± 39, rank #1649 of 1776 rated models, from 116 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR23.43Score98.4
AGC-Bench - unfun_corpus1.37Dataset z-score97.4
AGC-Bench - creatset1.61Dataset z-score97
Open LLM Leaderboard - BBH53.77Score96.3
LiveBench Typos62Score93.1
Open LLM Leaderboard - IFEval76.61Score92.3
BenchBench84.51Aggregate Score (%)91.9
LiveBench Table Reformat66Score91.7
AGC-Bench - science_analogies1.5Dataset z-score91.2
Open LLM Leaderboard - GPQA14.88Score90.8
Open CoT - LogiQA7.99CoT Gain (%)88.9
Open CoT - LSAT Logical Reasoning18.63CoT Gain (%)87.8

Interactive version: theaggregate.ai/model?slug=hermes-3-llama-3-1-70b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.