ConfigurableBeagle-11B — benchmark results

vicgalle's configurable-safety-tuning fine-tune of his CarbonBeagle-11B merge, letting the system prompt set the model's safety level. Provider: Other. Released 2024-02-17. Access: Open.

Unified ELO 1402 ± 19, rank #1215 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC63.65Accuracy (%)94.2
Open LLM Leaderboard - IFEval58.34Score70.2
Open Chinese LLM - ARC Challenge54.18Accuracy (%)63.9
Open LLM Leaderboard - BBH32.39Score61
Open Chinese LLM - WinoGrande63.61Accuracy (%)59.2
Open Chinese LLM Leaderboard57.26Average Score (%)58.2
Open LLM Leaderboard - GPQA6.94Score58.2
Open Korean LLM Leaderboard162.47Average Score (%)56.3
Open Chinese LLM - HellaSwag60.46Accuracy (%)52.2
Open LLM Leaderboard - MMLU-Pro26.38Score48.2
Open Chinese LLM - GSM8K44.28Accuracy (%)45.5
Open Chinese LLM - C-Eval Semantic64.96Accuracy (%)38.6

Interactive version: theaggregate.ai/model?slug=configurablebeagle-11b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.