RewardBench 2 Math — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 52 models tracked.

Top models

#ModelScore
1Qwen 3.6 Plus91.8
2Qwen 3.5 397B A17B91.8
3Kimi K2.691.26
4Qwen 3.5 122B A10B90.71
5NVIDIA-Nemotron-3-Super-120B-A12B-FP890.57
6MiMo-V2-Flash90.44
7GLM-4.6 FP890.44
8Qwen 3.6 35B A3B90.16
9Gemini 3.1 Pro (Preview)89.89
10Kimi K2 (Thinking)89.62
11GLM-5 FP889.62
12Qwen 3 Next 80B A3B (Thinking)89.34
13Step 3.5 Flash89.34
14GPT-5.589.21
15GPT-OSS-120B89.21

Interactive version: theaggregate.ai/benchmark?slug=rewardbench-2-math · How the rankings work · Data refreshed daily, snapshot 2026-07-22.