Hermes-2-Theta-Llama-3-8B — benchmark results

Nous Research's Hermes 2 Theta, a merge of Hermes 2 Pro with Llama 3 8B Instruct (with Arcee's Charles Goddard) followed by further RLHF. Provider: Nous Research. Released 2024-05-05. Access: Open.

Unified ELO 1414 ± 16, rank #1161 of 1776 rated models, from 21 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval65.18Score77.5
Open Chinese LLM - GSM8K53.37Accuracy (%)72.3
Open PL LLM Leaderboard55.24Average Score (%)68.4
Open PL LLM - Multiple Choice50.87Average Multiple-Choice Score (%)68.2
Open PL LLM - Generative58.59Average Generative Score (%)67.5
Open LLM Leaderboard - GPQA7.16Score60.3
Open Chinese LLM - TruthfulQA MC54.99Accuracy (%)60.2
Open PL LLM - RAG60.91Average RAG Score (%)59.8
Open LLM Leaderboard - BBH32.05Score59.7
Open Chinese LLM Leaderboard57.27Average Score (%)58.6
Polish EQ-Bench54.88EQ-Bench Score55.4
Open Chinese LLM - C-Eval Semantic70.95Accuracy (%)54.6

Interactive version: theaggregate.ai/model?slug=hermes-2-theta-llama-3-8b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.