Configurable-Llama-3-8B-v0.3: benchmark results

vicgalle's configurable-safety-tuning research fine-tune of Meta's Llama 3 8B, letting the system prompt set the model's safety level. Provider: Other. Released 2024-04-20. Access: Open.

Unified ELO 1461 ± 1, rank #896 of 1392 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC56.39Accuracy (%)70
Open Korean LLM Leaderboard39.42Average Score (%)68.7
Open Chinese LLM - GSM8K49.51Accuracy (%)65.3
Open Chinese LLM - C-Eval Semantic69.95Accuracy (%)51.6
Open Chinese LLM Leaderboard56.17Average Score (%)44.2
Open Chinese LLM - CMMLU52.83Accuracy (%)43.9
Open Chinese LLM - ARC Challenge48.72Accuracy (%)36.1
Open Chinese LLM - WinoGrande62.04Accuracy (%)35.8
Open Chinese LLM - HellaSwag53.78Accuracy (%)17.5

Interactive version: theaggregate.ai/model?slug=configurable-llama-3-8b-v0-3 · How It Works · Data refreshed daily, snapshot 2026-09-05.