tulu-2-dpo-13B — benchmark results
Provider: Allen AI. Released 2023-11-12. Access: Open.
Unified ELO 1336 ± 24, rank #1453 of 1776 rated models, from 19 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| RewardBench Chat | 95.81 | Accuracy (%) | 67.6 |
| AlpacaEval 1.0 | 88.12 | Win Rate (%) | 66.3 |
| RewardBench | 73.68 | Score (%) | 64.8 |
| BiGGen-Bench | 3.42 | Average Score (1-5) | 53.9 |
| Open CoT - LSAT Logical Reasoning | 9.41 | CoT Gain (%) | 45 |
| RewardBench Safety | 79.46 | Accuracy (%) | 44.6 |
| RewardBench Chat Hard | 58.33 | Accuracy (%) | 41.5 |
| HREF | 14.81 | Average HREF Score (%) | 39.4 |
| Open CoT - LogiQA 2 | 5.15 | CoT Gain (%) | 38.9 |
| Open CoT - LogiQA | 2.88 | CoT Gain (%) | 36.6 |
| Open CoT Leaderboard | 4.91 | Average CoT Gain (%) | 30.5 |
| SALAD-Bench Base | 86.51 | Safety Score (%) | 30.3 |
Interactive version: theaggregate.ai/model?slug=tulu-2-dpo-13b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.