Eurus-RM-7B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1491 ± 41, rank #772 of 1605 rated models, from 22 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench Chat98.04Accuracy (%)94.9
RewardBench Prior Sets (0.5 weight)71.72Score (%)86.5
RewardBench81.59Score (%)77.8
RewardBench Reasoning86.33Accuracy (%)60.9
RewardBench Chat Hard65.57Accuracy (%)59.1
RewardBench Ties59.72Score (%)56.8
RewardBench Focus74.75Score (%)54.6
RewardBench Safety81.35Accuracy (%)51.5
Themis-CodeRewardBench - Security Hardness63.07Preference accuracy (%; share of the benchmark's preference 36.7
Themis-CodeRewardBench - Readability and Maintainability61.44Preference accuracy (%; share of the benchmark's preference 28
RewardBench Precise IF34.38Score (%)27.8
Themis-CodeRewardBench - Memory Efficiency58.13Preference accuracy (%; share of the benchmark's preference 27.6

Interactive version: theaggregate.ai/model?slug=eurus-rm-7b · How It Works · Data refreshed daily, snapshot 2026-09-26.