URM-LLaMa-3.1-8B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1745 ± 40, rank #158 of 1605 rated models, from 19 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench Focus97.58Score (%)99.5
RewardBench92.94Score (%)96.3
RewardBench Chat Hard88.16Accuracy (%)94.9
RewardBench Precise IF45Score (%)93.1
RewardBench Reasoning96.98Accuracy (%)92.9
RewardBench Safety91.78Accuracy (%)91.2
RewardBench Ties76.53Score (%)87.4
RMGAP67.33Pairwise accuracy (%; chosen response scored above a rejecte75
RMGAP - Best-of-445.28Best-of-4 accuracy (%; chosen response scored above all thre75
RewardBench Math63.93Score (%)70.4
PMDC0.07Bradley-Terry ranking score (log-strength; ArmoRM-Llama3-8B-66.7
RewardBench Chat95.53Accuracy (%)63.9

Interactive version: theaggregate.ai/model?slug=urm-llama-3-1-8b · How It Works · Data refreshed daily, snapshot 2026-09-26.