gemma-2-9B-it-SimPO — benchmark results

Princeton NLP's SimPO reference-free preference-optimization research tune of Gemma 2 9B IT on UltraFeedback-ArmoRM data. Provider: Google. Released 2024-07-16. Access: API.

Unified ELO 1518 ± 43, rank #738 of 1776 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard774.57Average Score (%)97.9
AlpacaEval 2.072.35LC Win Rate (%)96.8
Open CoT - LSAT Analytical Reasoning8.26CoT Gain (%)89.3
WildBench53.28WB Score Task-Macro87.1
Open LLM Leaderboard - GPQA11.41Score82.7
Open CoT - LogiQA6.55CoT Gain (%)82.1
Open LLM Leaderboard - BBH40.09Score79.2
BenchBench73.28Aggregate Score (%)77.9
Open LLM Leaderboard - MMLU-Pro33.06Score73.2
Open CoT - LogiQA 29.99CoT Gain (%)69.1
Open CoT Leaderboard9.06Average CoT Gain (%)61.8
Open CoT - LSAT Logical Reasoning11.57CoT Gain (%)56.5

Interactive version: theaggregate.ai/model?slug=gemma-2-9b-it-simpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.