CarbonBeagle-11B: benchmark results

vicgalle's linear merge of his NeuralBeagle-11B with the SOLAR-based CarbonVillain-10.7B, briefly the top 11B-13B model on the Open LLM Leaderboard. Provider: Other. Released 2024-01-21. Access: Open.

Unified ELO 1485 ± 1, rank #761 of 1392 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC60.79Accuracy (%)84.6
Open Korean LLM Leaderboard42.45Average Score (%)83.4
Open Chinese LLM - ARC Challenge56.14Accuracy (%)71.4
Open LLM Leaderboard - IFEval54.15Score65
Open LLM Leaderboard - BBH33.06Score64.3
Open Chinese LLM Leaderboard58.04Average Score (%)61.7
Open Chinese LLM - HellaSwag61.29Accuracy (%)61.4
Open Chinese LLM - GSM8K47.84Accuracy (%)59.9
Open LLM Leaderboard - GPQA6.94Score58.3
Open Chinese LLM - WinoGrande62.9Accuracy (%)50.1
Open LLM Leaderboard - MMLU-Pro25.29Score45.3
Open LLM Leaderboard - MuSR9.19Score44.4

Interactive version: theaggregate.ai/model?slug=carbonbeagle-11b · How It Works · Data refreshed daily, snapshot 2026-09-05.