gemma-2-9B-it-SimPO: benchmark results

Princeton NLP's SimPO reference-free preference-optimization research tune of Gemma 2 9B IT on UltraFeedback-ArmoRM data. Provider: Google. Released 2024-07-16. Access: Open.

Unified ELO 1561 ± 1, rank #398 of 1392 rated models, from 29 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AlpacaEval 2.072.35LC Win Rate (%)96.8
Open Korean LLM Leaderboard47.27Average Score (%)94.9
Open CoT - LSAT Analytical Reasoning8.26CoT Gain (%)89.3
WildBench53.28WB Score Task-Macro87.1
Open LLM Leaderboard - GPQA11.41Score82.7
Open CoT - LogiQA6.55CoT Gain (%)82.1
Open LLM Leaderboard - BBH40.09Score79.2
BenchBench73.28Aggregate Score (%)77.9
Open LLM Leaderboard - MMLU-Pro33.06Score73.2
Open CoT - LogiQA 29.99CoT Gain (%)69.1
Open CoT Leaderboard9.06Average CoT Gain (%)61.8
Open CoT - LSAT Logical Reasoning11.57CoT Gain (%)56.5

Interactive version: theaggregate.ai/model?slug=gemma-2-9b-it-simpo · How It Works · Data refreshed daily, snapshot 2026-09-05.