CarbonBeagle-11B-truthy — benchmark results

Provider: Other. Released 2024-02-01. Access: Open.

Unified ELO 1388 ± 20, rank #1276 of 1776 rated models, from 25 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC65.08Accuracy (%)96.4
Open Medical LLM - MMLU Professional Medicine75Accuracy (%)83.5
Open Medical LLM - MMLU College Medicine65.9Accuracy (%)75.3
Open Chinese LLM - ARC Challenge55.8Accuracy (%)69.9
Open LLM Leaderboard - BBH33.99Score66.8
Open Chinese LLM Leaderboard58.62Average Score (%)65.9
Open LLM Leaderboard - IFEval52.12Score62.1
Open Chinese LLM - HellaSwag61.3Accuracy (%)61.7
Open Korean LLM Leaderboard227.28Average Score (%)60.6
Open Medical LLM - MMLU College Biology75.69Accuracy (%)59.1
Open Chinese LLM - GSM8K47.23Accuracy (%)56.1
Open LLM Leaderboard - GPQA6.6Score55.6

Interactive version: theaggregate.ai/model?slug=carbonbeagle-11b-truthy · How the rankings work · Data refreshed daily, snapshot 2026-07-22.