tulu-2-dpo-70B-ExPO — benchmark results

Provider: Allen AI. Released 2024-04-26. Access: Open.

Unified ELO 1380 ± 32, rank #1314 of 1776 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC58.77Accuracy (%)78.3
Open Chinese LLM - ARC Challenge57.51Accuracy (%)75.2
Open Chinese LLM - CMMLU58.18Accuracy (%)66.2
Open Chinese LLM - HellaSwag61.49Accuracy (%)63.4
AlpacaEval 2.025.72LC Win Rate (%)62.2
Open Chinese LLM - WinoGrande62.98Accuracy (%)51.2
Open Chinese LLM - C-Eval Semantic69.86Accuracy (%)51
Open Chinese LLM Leaderboard54.36Average Score (%)33.2
Open Chinese LLM - GSM8K11.75Accuracy (%)10.1

Interactive version: theaggregate.ai/model?slug=tulu-2-dpo-70b-expo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.