Configurable-Hermes-2-Pro-Llama-3-8B — benchmark results

vicgalle's configurable-safety-tuning (CST) research fine-tune of Hermes 2 Pro Llama 3 8B, letting the system prompt set safety behavior at inference. Provider: Other. Released 2024-05-02. Access: Open.

Unified ELO 1424 ± 10, rank #1111 of 1776 rated models, from 21 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard487.36Average Score (%)86.3
Open CoT - LSAT Logical Reasoning15.69CoT Gain (%)75.2
Open Chinese LLM - TruthfulQA MC56.7Accuracy (%)71.5
Open LLM Leaderboard - IFEval57.63Score69.5
Open CoT - LogiQA 29.99CoT Gain (%)69.1
Open CoT - LSAT Reading Comprehension15.24CoT Gain (%)67.9
Open CoT Leaderboard9.93Average CoT Gain (%)67.9
Open CoT - LogiQA5.27CoT Gain (%)65.6
Open LLM Leaderboard - BBH30.51Score53.7
Open LLM Leaderboard - GPQA6.26Score52.5
Open LLM Leaderboard - MuSR10.06Score50
Open Chinese LLM - GSM8K45.64Accuracy (%)49.6

Interactive version: theaggregate.ai/model?slug=configurable-hermes-2-pro-llama-3-8b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.