UltraRM-13B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1291 ± 37, rank #1428 of 1605 rated models, from 23 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench Prior Sets (0.5 weight)72.94Score (%)90.4
RewardBench Chat96.37Accuracy (%)73.3
Themis-CodeRewardBench - Readability and Maintainability71.18Preference accuracy (%; share of the benchmark's preference 72
Themis-CodeRewardBench - Security Hardness72.45Preference accuracy (%; share of the benchmark's preference 71.4
Themis-CodeRewardBench - Memory Efficiency66.44Preference accuracy (%; share of the benchmark's preference 60.2
RewardBench69.03Score (%)53.4
Open LLM Leaderboard v1 - TruthfulQA MC247.91MC2 (%) (0-shot)39.2
RewardBench Chat Hard55.48Accuracy (%)34.7
RewardBench Focus60.81Score (%)29.8
Themis-CodeRewardBench70.43Preference accuracy (%; share of the benchmark's preference 28
Themis-CodeRewardBench - Functional Correctness74.17Preference accuracy (%; share of the benchmark's preference 22.4
RewardBench Precise IF33.12Score (%)21.7

Interactive version: theaggregate.ai/model?slug=ultrarm-13b · How It Works · Data refreshed daily, snapshot 2026-09-26.