Starling-RM-34B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1503 ± 47, rank #731 of 1605 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench Prior Sets (0.5 weight)71.37Score (%)85.6
RewardBench Chat96.93Accuracy (%)83
RewardBench81.33Score (%)77.5
RewardBench Safety87.7Accuracy (%)74.8
RewardBench Reasoning88.45Accuracy (%)66.9
Themis-CodeRewardBench - Security Hardness68.72Preference accuracy (%; share of the benchmark's preference 63.3
Themis-CodeRewardBench - Memory Efficiency63.67Preference accuracy (%; share of the benchmark's preference 50
RewardBench Math61.75Score (%)49
RewardBench Chat Hard57.24Accuracy (%)38.4
Themis-CodeRewardBench - Readability and Maintainability64.58Preference accuracy (%; share of the benchmark's preference 38
Themis-CodeRewardBench70.63Preference accuracy (%; share of the benchmark's preference 32
Themis-CodeRewardBench - Functional Correctness77.75Preference accuracy (%; share of the benchmark's preference 29.6

Interactive version: theaggregate.ai/model?slug=starling-rm-34b · How It Works · Data refreshed daily, snapshot 2026-09-26.