Llama-3-OffsetBias-RM-8B: benchmark results

Provider: Meta. Access: Open.

Unified ELO 1658 ± 45, rank #311 of 1605 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench Focus95.96Score (%)96.2
RewardBench89.42Score (%)91
RewardBench Chat97.21Accuracy (%)86.9
RewardBench Chat Hard81.8Accuracy (%)84.1
RewardBench Reasoning91.92Accuracy (%)76.9
RewardBench Precise IF40Score (%)71.9
RewardBench Ties67.86Score (%)71.6
RewardBench Safety86.76Accuracy (%)70.8
Themis-CodeRewardBench71.76Preference accuracy (%; share of the benchmark's preference 45
Themis-CodeRewardBench - Functional Correctness79.8Preference accuracy (%; share of the benchmark's preference 44.9
Themis-CodeRewardBench - Security Hardness65.29Preference accuracy (%; share of the benchmark's preference 44.9
Themis-CodeRewardBench - Execution Efficiency59.05Preference accuracy (%; share of the benchmark's preference 38.8

Interactive version: theaggregate.ai/model?slug=llama-3-offsetbias-rm-8b · How It Works · Data refreshed daily, snapshot 2026-09-26.