internlm2-1.8B-reward: benchmark results

Provider: Shanghai AI Lab. Access: Open.

Unified ELO 1438 ± 46, rank #985 of 1605 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench82.17Score (%)78.7
RewardBench Reasoning87.24Accuracy (%)64.5
RewardBench Chat Hard66.23Accuracy (%)60.8
RewardBench Safety81.62Accuracy (%)52.2
RewardBench Chat93.58Accuracy (%)45.5
RewardBench Precise IF36.25Score (%)42.1
Themis-CodeRewardBench - Readability and Maintainability64.71Preference accuracy (%; share of the benchmark's preference 41
Themis-CodeRewardBench - Memory Efficiency62.28Preference accuracy (%; share of the benchmark's preference 37.8
Themis-CodeRewardBench - Security Hardness62.36Preference accuracy (%; share of the benchmark's preference 31.6
RewardBench Focus59.6Score (%)26.5
Themis-CodeRewardBench63.84Preference accuracy (%; share of the benchmark's preference 18
Themis-CodeRewardBench - Functional Correctness67.06Preference accuracy (%; share of the benchmark's preference 14.3

Interactive version: theaggregate.ai/model?slug=internlm2-1-8b-reward · How It Works · Data refreshed daily, snapshot 2026-09-26.