tulu-2-dpo-7B — benchmark results

Provider: Allen AI. Released 2023-11-12. Access: Open.

Unified ELO 1319 ± 21, rank #1495 of 1776 rated models, from 26 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench Chat97.49Accuracy (%)90.1
RewardBench72.12Score (%)60.2
JustEval - Depth4.36Score (1-5)60
AlpacaEval 1.084.22Win Rate (%)54.5
JustEval - Engagement4.69Score (1-5)46.7
JustEval - Helpfulness4.64Score (1-5)46.7
BiGGen-Bench3.28Average Score (1-5)44.1
JustEval4.67Avg Score (1-5)36.7
JustEval - Clarity4.92Score (1-5)36.7
RewardBench Chat Hard56.14Accuracy (%)36.1
Open CoT - LSAT Analytical Reasoning2.61CoT Gain (%)34
JustEval - Factuality4.53Score (1-5)33.3

Interactive version: theaggregate.ai/model?slug=tulu-2-dpo-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.