gemma-2-9B-it-DPO — benchmark results
Princeton NLP's DPO fine-tune of Gemma 2 9B IT on ultrafeedback-armorm, the DPO baseline counterpart to their SimPO model. Provider: Google. Released 2024-07-16. Access: API.
Unified ELO 1478 ± 72, rank #884 of 1776 rated models, from 10 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AlpacaEval 2.0 | 67.66 | LC Win Rate (%) | 95 |
| WildBench | 53.22 | WB Score Task-Macro | 85.5 |
| BenchBench | 81.01 | Aggregate Score (%) | 85.3 |
| Open LLM Leaderboard - GPQA | 11.41 | Score | 82.7 |
| Open LLM Leaderboard - BBH | 41.59 | Score | 80.8 |
| Open LLM Leaderboard - MMLU-Pro | 30.26 | Score | 61.2 |
| Open Korean LLM Leaderboard | 44.89 | Average Score (%) | 46.1 |
| Open LLM Leaderboard - MATH Level 5 | 8.31 | Score | 41.9 |
| Open LLM Leaderboard - MuSR | 5.65 | Score | 27.4 |
| Open LLM Leaderboard - IFEval | 27.69 | Score | 24.7 |
Interactive version: theaggregate.ai/model?slug=gemma-2-9b-it-dpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.