Med-RewardBench: leaderboard
Metric: Expert-Agreement Accuracy (%; pairwise, six dimensions). Source: arxiv.org. Saturation forecast: Estimated already saturated. 34 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | O1 | 68.86 |
| 2 | Qwen 2.5 VL 7B | 64.99 |
| 3 | Gemini 1.5 Pro | 63.51 |
| 4 | InternVL3-8B | 62.3 |
| 5 | Pixtral-12B | 61.63 |
| 6 | Claude 3.5 Sonnet | 60.26 |
| 7 | InternVL2-8B | 56.42 |
| 8 | Qwen 2 VL 7B Instruct | 52.16 |
| 9 | GPT-4o | 52.06 |
Interactive version: theaggregate.ai/benchmark?slug=med-rewardbench · How It Works · Data refreshed daily, snapshot 2026-09-25.