gemma-2-9b_dpo-v4-hq: benchmark results

Provider: Google. Released 2024-08-14. Access: API.

Unified ELO 1598 ± 17, rank #636 of 2656 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM - Ko-EQ-Bench60.19EQ-Bench score99.1
Open Korean LLM - Ko-IFEval67.89Strict accuracy, prompt/instruction mean (%)99
Open Ko-LLM Leaderboard51.82Average (%)98.4
Open Korean LLM Leaderboard51.82Average Score (%)98.4
Open Korean LLM - Ko-GSM8K (flexible extract)69.6Exact match, flexible extract (%)98.2
Open Korean LLM - KorNAT-CKA33.72Normalized accuracy (%)93
Open Korean LLM - KorNAT-Helpful51Normalized accuracy (%)88.5
Open Korean LLM - KorNAT-Harmless67Normalized accuracy (%)87.6
Open Korean LLM - Ko-Winogrande64.64Accuracy (%)79.8
Open Korean LLM - Ko-GPQA-Diamond23.74Normalized accuracy (%)55.6

Interactive version: theaggregate.ai/model?slug=gemma-2-9b-dpo-v4-hq · How It Works · Data refreshed daily, snapshot 2026-09-19.