Nous-Hermes-2-Yi-34B — benchmark results
Nous Research's Hermes 2 fine-tune of 01.AI's Yi-34B, trained on ~1M mostly GPT-4-generated samples with ChatML formatting (December 2023). Provider: Nous Research. Released 2023-12-23. Access: Open.
Unified ELO 1472 ± 19, rank #901 of 1776 rated models, from 9 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Chinese LLM - WinoGrande | 70.56 | Accuracy (%) | 94.2 |
| Open Chinese LLM - HellaSwag | 69.02 | Accuracy (%) | 90.2 |
| Open Chinese LLM - C-Eval Semantic | 88.73 | Accuracy (%) | 88.6 |
| Open Chinese LLM Leaderboard | 67.2 | Average Score (%) | 87.5 |
| Open Chinese LLM - ARC Challenge | 59.98 | Accuracy (%) | 87.2 |
| Open Chinese LLM - CMMLU | 70.04 | Accuracy (%) | 85.2 |
| Open Chinese LLM - GSM8K | 57.16 | Accuracy (%) | 79.2 |
| BiGGen-Bench | 3.48 | Average Score (1-5) | 59.8 |
| Open Chinese LLM - TruthfulQA MC | 54.88 | Accuracy (%) | 59.1 |
Interactive version: theaggregate.ai/model?slug=nous-hermes-2-yi-34b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.