bagel-8B-v1.0: benchmark results
Provider: Jon Durbin. Released 2024-02-20. Access: Open.
Unified ELO 1508 ± 13, rank #1041 of 2656 rated models, from 34 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Korean LLM - Ko-GPQA-Diamond | 28.79 | Normalized accuracy (%) | 98.1 |
| Open Korean LLM Leaderboard | 43.19 | Average Score (%) | 87.5 |
| Open Ko-LLM Leaderboard | 43.19 | Average (%) | 87.4 |
| Open Medical LLM - MMLU Anatomy | 68.89 | Accuracy (%) | 83.5 |
| Open Medical LLM - MMLU Clinical Knowledge | 75.09 | Accuracy (%) | 81.5 |
| Open Portuguese LLM - ASSIN2 RTE | 92.63 | Macro F1 (%) | 81.2 |
| Open Portuguese LLM - ENEM | 71.45 | Accuracy (%) | 80.4 |
| Open Korean LLM - Ko-GSM8K (flexible extract) | 44.2 | Exact match, flexible extract (%) | 79.2 |
| Open Korean LLM - KorNAT-Harmless | 65.08 | Normalized accuracy (%) | 78.9 |
| Open Medical LLM - MedMCQA | 57.04 | Accuracy (%) | 76.4 |
| Open Korean LLM - Ko-IFEval | 36.14 | Strict accuracy, prompt/instruction mean (%) | 74.9 |
| Open Medical LLM - MMLU College Biology | 78.47 | Accuracy (%) | 74.7 |
Interactive version: theaggregate.ai/model?slug=bagel-8b-v1-0 · How It Works · Data refreshed daily, snapshot 2026-09-19.