QRM-Llama3.1-8B-v2: benchmark results

Provider: Other. Access: Open.

Unified ELO 1774 ± 51, rank #196 of 2656 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench Safety94.67Accuracy (%)98.1
RewardBench93.14Score (%)97.2
RewardBench Reasoning96.77Accuracy (%)92.3
RewardBench Chat Hard86.84Accuracy (%)92
RewardBench Focus89.09Score (%)83.4
RewardBench Ties72.34Score (%)80.5
RewardBench Precise IF40.62Score (%)77.3
RewardBench Chat96.37Accuracy (%)73.3
RewardBench Factuality66.53Accuracy (%)45.9
RewardBench Math61.2Score (%)43.9
StoryAlign14.9Average (self-reported)0

Interactive version: theaggregate.ai/model?slug=qrm-llama3-1-8b-v2 · How It Works · Data refreshed daily, snapshot 2026-09-19.