RewardBench 2 Safety — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 52 models tracked.

Top models

#ModelScore
1Qwen3-VL-235B-A22B-Thinking-FP896.44
2Qwen 3 Next 80B A3B (Thinking)94.89
3Qwen 3.5 122B A10B94.67
4Qwen 3.5 397B A17B94
5Qwen 3 30B A3B 2507 (Thinking)93.61
6GPT-5.593.39
7GLM-5 FP892.06
8GPT-OSS-120B91.11
9Mistral-Large-3-675B-Instruct-251290.33
10GPT-5 Mini89.56
11Qwen 3.6 35B A3B89.33
12command-a-reasoning-08-202588.61
13Kimi K2.588.28
14Kimi K2.688.22
15Kimi K2 (Thinking)88.22

Interactive version: theaggregate.ai/benchmark?slug=rewardbench-2-safety · How the rankings work · Data refreshed daily, snapshot 2026-07-22.