BeagSake-7B: benchmark results

Provider: Other. Released 2024-03-01. Access: Open.

Unified ELO 1459 ± 1, rank #901 of 1392 rated models, from 25 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC61.95Accuracy (%)89.9
Open Korean LLM Leaderboard42.65Average Score (%)84.3
Open Medical LLM - PubMedQA76Accuracy (%)80.1
Open LLM Leaderboard - IFEval52.16Score62.2
Open Medical LLM - MMLU College Medicine64.16Accuracy (%)60.5
Open Chinese LLM - GSM8K47.16Accuracy (%)55
Open Chinese LLM - HellaSwag60.08Accuracy (%)49.7
Open Chinese LLM - ARC Challenge52.22Accuracy (%)48.7
Open LLM Leaderboard - MuSR9.84Score48.5
Open Medical LLM - MMLU Clinical Knowledge70.57Accuracy (%)48.3
Open Chinese LLM Leaderboard56.47Average Score (%)48.1
Open Medical LLM - MMLU Anatomy59.26Accuracy (%)46.3

Interactive version: theaggregate.ai/model?slug=beagsake-7b · How It Works · Data refreshed daily, snapshot 2026-09-05.