Med-RewardBench: leaderboard

Metric: Expert-Agreement Accuracy (%; pairwise, six dimensions). Source: arxiv.org. Saturation forecast: Estimated already saturated. 34 models tracked.

Top models

#ModelScore
1O168.86
2Qwen 2.5 VL 7B64.99
3Gemini 1.5 Pro63.51
4InternVL3-8B62.3
5Pixtral-12B61.63
6Claude 3.5 Sonnet60.26
7InternVL2-8B56.42
8Qwen 2 VL 7B Instruct52.16
9GPT-4o52.06

Interactive version: theaggregate.ai/benchmark?slug=med-rewardbench · How It Works · Data refreshed daily, snapshot 2026-09-25.