Hermes 3 - Llama-3.1 70B: benchmark results

Provider: Nous Research. Released 2024-08-16. Access: Open.

Unified ELO 1439 ± 1, rank #992 of 1392 rated models, from 95 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR23.43Score98.4
AGC-Bench - unfun_corpus1.37Dataset z-score97.4
AGC-Bench - creatset1.61Dataset z-score97
Open LLM Leaderboard - BBH53.77Score96.3
Open LLM Leaderboard - IFEval76.61Score92.3
BenchBench84.51Aggregate Score (%)91.9
AGC-Bench - science_analogies1.5Dataset z-score91.2
Open LLM Leaderboard - GPQA14.88Score90.8
Open CoT - LogiQA7.99CoT Gain (%)88.9
Open CoT - LSAT Logical Reasoning18.63CoT Gain (%)87.8
Open LLM Leaderboard - MMLU-Pro41.41Score86.1
Open CoT - LSAT Analytical Reasoning7.39CoT Gain (%)84.7

Interactive version: theaggregate.ai/model?slug=hermes-3-llama-3-1-70b · How It Works · Data refreshed daily, snapshot 2026-09-05.