Medmarks - Open-Ended: leaderboard

Metric: Weighted Mean Win Rate (%). Source: medmarks.ai. Saturation forecast: Around November 2027. 12 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)63.89
2GPT-5.1 (Medium)62.44
3GPT-OSS-120B (High)55.07
4Qwen 3 235B A22B (Thinking)51.61
5Claude Sonnet 4.549.98
6Gemini 3 Pro (Preview)47.13
7GLM-4.7 FP845.19
8GPT-OSS-20B (High)42.66
9Qwen 3 30B A3B (Thinking)41.3
10Qwen 3 8B (Thinking)36.34

Interactive version: theaggregate.ai/benchmark?slug=medmarks-open-ended · How It Works · Data refreshed daily, snapshot 2026-10-09.