bagel-dpo-34B-v0.5 — benchmark results

Jon Durbin's bagel v0.5 DPO tune of Yi-34B-200K, SFT'd on 40+ datasets in four prompt formats then refined with preference DPO. Provider: Jon Durbin. Released 2024-04-01. Access: Open.

Unified ELO 1424 ± 25, rank #1112 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - C-Eval Semantic90.06Accuracy (%)92.9
Open Chinese LLM - ARC Challenge62.37Accuracy (%)92.7
Open Chinese LLM - CMMLU71.31Accuracy (%)91.4
Open Chinese LLM - HellaSwag67.78Accuracy (%)84.4
Open Chinese LLM - WinoGrande67.32Accuracy (%)81.8
Open Chinese LLM Leaderboard61.82Average Score (%)74.2
Open Chinese LLM - TruthfulQA MC57.4Accuracy (%)73
RewardBench Reasoning88.89Accuracy (%)69.8
RewardBench72.15Score (%)60.5
RewardBench Chat93.85Accuracy (%)47.4
RewardBench Chat Hard55.04Accuracy (%)33.5
RewardBench Safety64.46Accuracy (%)17.9

Interactive version: theaggregate.ai/model?slug=bagel-dpo-34b-v0-5 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.