CarbonBeagle-11B — benchmark results
vicgalle's linear merge of his NeuralBeagle-11B with the SOLAR-based CarbonVillain-10.7B, briefly the top 11B-13B model on the Open LLM Leaderboard. Provider: Other. Released 2024-01-21. Access: Open.
Unified ELO 1420 ± 11, rank #1129 of 1776 rated models, from 15 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Chinese LLM - TruthfulQA MC | 60.79 | Accuracy (%) | 84.6 |
| Open Korean LLM Leaderboard | 407.42 | Average Score (%) | 78.1 |
| Open Chinese LLM - ARC Challenge | 56.14 | Accuracy (%) | 71.4 |
| Open LLM Leaderboard - IFEval | 54.15 | Score | 65 |
| Open LLM Leaderboard - BBH | 33.06 | Score | 64.3 |
| Open Chinese LLM Leaderboard | 58.04 | Average Score (%) | 61.7 |
| Open Chinese LLM - HellaSwag | 61.29 | Accuracy (%) | 61.4 |
| Open Chinese LLM - GSM8K | 47.84 | Accuracy (%) | 59.9 |
| Open LLM Leaderboard - GPQA | 6.94 | Score | 58.2 |
| Open Chinese LLM - WinoGrande | 62.9 | Accuracy (%) | 50.1 |
| Open LLM Leaderboard - MMLU-Pro | 25.29 | Score | 45.3 |
| Open LLM Leaderboard - MuSR | 9.19 | Score | 44.4 |
Interactive version: theaggregate.ai/model?slug=carbonbeagle-11b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.