Configurable-Llama-3-8B-v0.3 — benchmark results

vicgalle's configurable-safety-tuning research fine-tune of Meta's Llama 3 8B, letting the system prompt set the model's safety level. Provider: Other. Released 2024-04-20. Access: Open.

Unified ELO 1402 ± 12, rank #1216 of 1776 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard421.99Average Score (%)79.7
Open Chinese LLM - TruthfulQA MC56.39Accuracy (%)70
Open Chinese LLM - GSM8K49.51Accuracy (%)65.3
Open Chinese LLM - C-Eval Semantic69.95Accuracy (%)51.6
Open Chinese LLM Leaderboard56.17Average Score (%)44.2
Open Chinese LLM - CMMLU52.83Accuracy (%)43.9
Open Chinese LLM - ARC Challenge48.72Accuracy (%)36.1
Open Chinese LLM - WinoGrande62.04Accuracy (%)35.8
Open Chinese LLM - HellaSwag53.78Accuracy (%)17.5

Interactive version: theaggregate.ai/model?slug=configurable-llama-3-8b-v0-3 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.