CarbonBeagle-11B-truthy: benchmark results

Provider: Other. Released 2024-02-01. Access: Open.

Unified ELO 1459 ± 1, rank #902 of 1392 rated models, from 25 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC65.08Accuracy (%)96.4
Open Medical LLM - MMLU Professional Medicine75Accuracy (%)83.5
Open Korean LLM Leaderboard41.33Average Score (%)79.3
Open Medical LLM - MMLU College Medicine65.9Accuracy (%)75.3
Open Chinese LLM - ARC Challenge55.8Accuracy (%)69.9
Open LLM Leaderboard - BBH33.99Score66.8
Open Chinese LLM Leaderboard58.62Average Score (%)65.9
Open LLM Leaderboard - IFEval52.12Score62.1
Open Chinese LLM - HellaSwag61.3Accuracy (%)61.7
Open Medical LLM - MMLU College Biology75.69Accuracy (%)59.1
Open Chinese LLM - GSM8K47.23Accuracy (%)56.1
Open LLM Leaderboard - GPQA6.6Score55.6

Interactive version: theaggregate.ai/model?slug=carbonbeagle-11b-truthy · How It Works · Data refreshed daily, snapshot 2026-09-05.