CarbonBeagle-11B — benchmark results

vicgalle's linear merge of his NeuralBeagle-11B with the SOLAR-based CarbonVillain-10.7B, briefly the top 11B-13B model on the Open LLM Leaderboard. Provider: Other. Released 2024-01-21. Access: Open.

Unified ELO 1420 ± 11, rank #1129 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC60.79Accuracy (%)84.6
Open Korean LLM Leaderboard407.42Average Score (%)78.1
Open Chinese LLM - ARC Challenge56.14Accuracy (%)71.4
Open LLM Leaderboard - IFEval54.15Score65
Open LLM Leaderboard - BBH33.06Score64.3
Open Chinese LLM Leaderboard58.04Average Score (%)61.7
Open Chinese LLM - HellaSwag61.29Accuracy (%)61.4
Open Chinese LLM - GSM8K47.84Accuracy (%)59.9
Open LLM Leaderboard - GPQA6.94Score58.2
Open Chinese LLM - WinoGrande62.9Accuracy (%)50.1
Open LLM Leaderboard - MMLU-Pro25.29Score45.3
Open LLM Leaderboard - MuSR9.19Score44.4

Interactive version: theaggregate.ai/model?slug=carbonbeagle-11b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.