RewardBench 2 Precise IF — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 52 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)75.78
2Qwen 3.5 397B A17B75.62
3GPT-5.574.38
4Qwen 3.6 Plus73.75
5Qwen 3.5 122B A10B73.75
6GLM-5.1 FP873.28
7GLM-5 FP871.56
8Kimi K2.671.25
9Kimi K2.570
10GPT-5 Mini69.84
11GPT-OSS-120B69.53
12Kimi K2 (Thinking)69.06
13DeepSeek-V4-Flash-FP868.91
14DeepSeek V3.2 Speciale68.75
15NVIDIA-Nemotron-3-Super-120B-A12B-FP868.44

Interactive version: theaggregate.ai/benchmark?slug=rewardbench-2-precise-if · How the rankings work · Data refreshed daily, snapshot 2026-07-22.