GRM-llama3-8B-sftreg: benchmark results

Provider: Other. Access: Open.

Unified ELO 1612 ± 43, rank #417 of 1605 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench Chat98.6Accuracy (%)98.3
RewardBench Prior Sets (0.5 weight)73.09Score (%)91.3
RewardBench85.42Score (%)84.9
RewardBench Safety89.19Accuracy (%)80.2
RewardBench Reasoning92.29Accuracy (%)78.1
RewardBench Precise IF38.75Score (%)61.7
RewardBench Chat Hard67.76Accuracy (%)61.4
Themis-CodeRewardBench - Security Hardness67Preference accuracy (%; share of the benchmark's preference 59.2
RewardBench Ties59.81Score (%)57.4
Themis-CodeRewardBench - Readability and Maintainability66.11Preference accuracy (%; share of the benchmark's preference 50
Themis-CodeRewardBench71.81Preference accuracy (%; share of the benchmark's preference 49
RewardBench Focus68.28Score (%)40.3

Interactive version: theaggregate.ai/model?slug=grm-llama3-8b-sftreg · How It Works · Data refreshed daily, snapshot 2026-09-26.