Hermes-2-Theta-Llama-3-8B — benchmark results
Nous Research's Hermes 2 Theta, a merge of Hermes 2 Pro with Llama 3 8B Instruct (with Arcee's Charles Goddard) followed by further RLHF. Provider: Nous Research. Released 2024-05-05. Access: Open.
Unified ELO 1414 ± 16, rank #1161 of 1776 rated models, from 21 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - IFEval | 65.18 | Score | 77.5 |
| Open Chinese LLM - GSM8K | 53.37 | Accuracy (%) | 72.3 |
| Open PL LLM Leaderboard | 55.24 | Average Score (%) | 68.4 |
| Open PL LLM - Multiple Choice | 50.87 | Average Multiple-Choice Score (%) | 68.2 |
| Open PL LLM - Generative | 58.59 | Average Generative Score (%) | 67.5 |
| Open LLM Leaderboard - GPQA | 7.16 | Score | 60.3 |
| Open Chinese LLM - TruthfulQA MC | 54.99 | Accuracy (%) | 60.2 |
| Open PL LLM - RAG | 60.91 | Average RAG Score (%) | 59.8 |
| Open LLM Leaderboard - BBH | 32.05 | Score | 59.7 |
| Open Chinese LLM Leaderboard | 57.27 | Average Score (%) | 58.6 |
| Polish EQ-Bench | 54.88 | EQ-Bench Score | 55.4 |
| Open Chinese LLM - C-Eval Semantic | 70.95 | Accuracy (%) | 54.6 |
Interactive version: theaggregate.ai/model?slug=hermes-2-theta-llama-3-8b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.