bagel-dpo-34B-v0.2: benchmark results

Provider: Jon Durbin. Released 2024-01-01. Access: Open.

Unified ELO 1604 ± 32, rank #615 of 2656 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Portuguese LLM - FaQuAD NLI83.86Macro F1 (%)97.4
Open Chinese LLM - ARC Challenge64.42Accuracy (%)96.1
Open Chinese LLM - CMMLU72.06Accuracy (%)94.4
Open Chinese LLM - C-Eval Semantic90.03Accuracy (%)92.6
Open Chinese LLM - HellaSwag69.58Accuracy (%)91.7
Open Chinese LLM - WinoGrande70.01Accuracy (%)91.5
Open Portuguese LLM - BLUEX66.9Accuracy (%)89.4
Open Chinese LLM Leaderboard68.07Average Score (%)89.3
Open Chinese LLM - TruthfulQA MC60.61Accuracy (%)84.3
Open Portuguese LLM - OAB Exams53.03Accuracy (%)82.9
Open Portuguese LLM - ENEM71.94Accuracy (%)81.7
Open Portuguese LLM - ASSIN2 RTE91.53Macro F1 (%)67.7

Interactive version: theaggregate.ai/model?slug=bagel-dpo-34b-v0-2 · How It Works · Data refreshed daily, snapshot 2026-09-19.