bagel-8B-v1.0: benchmark results

Provider: Jon Durbin. Released 2024-02-20. Access: Open.

Unified ELO 1508 ± 13, rank #1041 of 2656 rated models, from 34 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM - Ko-GPQA-Diamond28.79Normalized accuracy (%)98.1
Open Korean LLM Leaderboard43.19Average Score (%)87.5
Open Ko-LLM Leaderboard43.19Average (%)87.4
Open Medical LLM - MMLU Anatomy68.89Accuracy (%)83.5
Open Medical LLM - MMLU Clinical Knowledge75.09Accuracy (%)81.5
Open Portuguese LLM - ASSIN2 RTE92.63Macro F1 (%)81.2
Open Portuguese LLM - ENEM71.45Accuracy (%)80.4
Open Korean LLM - Ko-GSM8K (flexible extract)44.2Exact match, flexible extract (%)79.2
Open Korean LLM - KorNAT-Harmless65.08Normalized accuracy (%)78.9
Open Medical LLM - MedMCQA57.04Accuracy (%)76.4
Open Korean LLM - Ko-IFEval36.14Strict accuracy, prompt/instruction mean (%)74.9
Open Medical LLM - MMLU College Biology78.47Accuracy (%)74.7

Interactive version: theaggregate.ai/model?slug=bagel-8b-v1-0 · How It Works · Data refreshed daily, snapshot 2026-09-19.