gemma-2-9B-it-WPO-HB — benchmark results
wzhouad's WPO (Weighted Preference Optimization) research tune of Gemma 2 9B IT using hybrid on-policy and GPT-4-turbo preference data. Provider: Google. Released 2024-08-08. Access: API.
Unified ELO 1523 ± 88, rank #712 of 1776 rated models, from 7 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AlpacaEval 2.0 | 76.73 | LC Win Rate (%) | 98.2 |
| Open LLM Leaderboard - GPQA | 13.31 | Score | 87.6 |
| Open LLM Leaderboard - BBH | 36.66 | Score | 75.7 |
| Open LLM Leaderboard - IFEval | 54.37 | Score | 65.4 |
| Open LLM Leaderboard - MATH Level 5 | 15.33 | Score | 62.5 |
| Open LLM Leaderboard - MMLU-Pro | 26.22 | Score | 47.9 |
| Open LLM Leaderboard - MuSR | 3.97 | Score | 19.5 |
Interactive version: theaggregate.ai/model?slug=gemma-2-9b-it-wpo-hb · How the rankings work · Data refreshed daily, snapshot 2026-07-22.