InternLM2-20B-Reward: benchmark results

Provider: Shanghai AI Lab. Access: Open.

Unified ELO 1650 ± 49, rank #458 of 2656 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench Chat98.88Accuracy (%)98.9
RewardBench90.16Score (%)92.3
RewardBench Reasoning95.76Accuracy (%)87.6
RewardBench Safety89.46Accuracy (%)81.5
RewardBench Chat Hard76.54Accuracy (%)74.7
RewardBench Ties54.83Score (%)47.4
RewardBench Focus72.53Score (%)47.2
RewardBench Precise IF36.25Score (%)42.1
RewardBench Math57.38Score (%)20.9
RewardBench Factuality55.58Accuracy (%)17.9
StoryAlign21.3Average (self-reported)14.3

Interactive version: theaggregate.ai/model?slug=internlm2-20b-reward · How It Works · Data refreshed daily, snapshot 2026-09-19.