LDL-Reward-Gemma-2-27B-v0.1: benchmark results

Provider: Other. Access: Open.

Unified ELO 1803 ± 45, rank #87 of 1605 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench94.99Score (%)99.7
RewardBench Reasoning99.03Accuracy (%)99.4
RewardBench Chat Hard90.79Accuracy (%)98.9
RewardBench Safety93.78Accuracy (%)96.6
RewardBench Factuality75.58Accuracy (%)90.1
RewardBench Focus91.31Score (%)88.3
RewardBench Ties76.33Score (%)86.3
Themis-CodeRewardBench - Execution Efficiency65.47Preference accuracy (%; share of the benchmark's preference 83.7
RewardBench Math64.48Score (%)73.7
RewardBench Chat96.37Accuracy (%)73.3
Themis-CodeRewardBench - Functional Correctness84.28Preference accuracy (%; share of the benchmark's preference 71.4
Themis-CodeRewardBench75.57Preference accuracy (%; share of the benchmark's preference 64

Interactive version: theaggregate.ai/model?slug=ldl-reward-gemma-2-27b-v0-1 · How It Works · Data refreshed daily, snapshot 2026-09-26.