Hermes-3-Llama-3.2-3B — benchmark results

Provider: Nous Research. Released 2024-12-03. Access: Open.

Unified ELO 1303 ± 18, rank #1528 of 1776 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR8.58Score41.2
Open LLM Leaderboard - IFEval38.25Score37.7
MT-Bench PL - Roleplay6.75Judge Score (0-10)35.7
MT-Bench PL - Coding4.45Judge Score (0-10)32.7
MT-Bench PL - Math3.7Judge Score (0-10)30.6
Open LLM Leaderboard - BBH20.19Score30.2
Open LLM Leaderboard - GPQA3.36Score30.2
MT-Bench PL - STEM6.95Judge Score (0-10)26.5
Open LLM Leaderboard - MMLU-Pro17.16Score26.1
MT-Bench PL - Humanities8.05Judge Score (0-10)24.5
MT-Bench PL - Overall5.54Judge Score (0-10)24.5
Open LLM Leaderboard - MATH Level 53.93Score22.6

Interactive version: theaggregate.ai/model?slug=hermes-3-llama-3-2-3b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.