gemma-2-9B-it-WPO-HB — benchmark results

wzhouad's WPO (Weighted Preference Optimization) research tune of Gemma 2 9B IT using hybrid on-policy and GPT-4-turbo preference data. Provider: Google. Released 2024-08-08. Access: API.

Unified ELO 1523 ± 88, rank #712 of 1776 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AlpacaEval 2.076.73LC Win Rate (%)98.2
Open LLM Leaderboard - GPQA13.31Score87.6
Open LLM Leaderboard - BBH36.66Score75.7
Open LLM Leaderboard - IFEval54.37Score65.4
Open LLM Leaderboard - MATH Level 515.33Score62.5
Open LLM Leaderboard - MMLU-Pro26.22Score47.9
Open LLM Leaderboard - MuSR3.97Score19.5

Interactive version: theaggregate.ai/model?slug=gemma-2-9b-it-wpo-hb · How the rankings work · Data refreshed daily, snapshot 2026-07-22.