tulu-2-dpo-13B — benchmark results

Provider: Allen AI. Released 2023-11-12. Access: Open.

Unified ELO 1336 ± 24, rank #1453 of 1776 rated models, from 19 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench Chat95.81Accuracy (%)67.6
AlpacaEval 1.088.12Win Rate (%)66.3
RewardBench73.68Score (%)64.8
BiGGen-Bench3.42Average Score (1-5)53.9
Open CoT - LSAT Logical Reasoning9.41CoT Gain (%)45
RewardBench Safety79.46Accuracy (%)44.6
RewardBench Chat Hard58.33Accuracy (%)41.5
HREF14.81Average HREF Score (%)39.4
Open CoT - LogiQA 25.15CoT Gain (%)38.9
Open CoT - LogiQA2.88CoT Gain (%)36.6
Open CoT Leaderboard4.91Average CoT Gain (%)30.5
SALAD-Bench Base86.51Safety Score (%)30.3

Interactive version: theaggregate.ai/model?slug=tulu-2-dpo-13b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.