Medmarks - Verifiable: leaderboard

Metric: Weighted Mean Win Rate (%). Source: medmarks.ai. Saturation forecast: Around November 2027. 89 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)64.52
2GPT-5.1 (Medium)62.08
3Grok 461.59
4Claude Sonnet 4.560.71
5GPT-5.2 (Medium)60.5
6GLM-4.7 FP860.1
7Qwen 3.5 27B (Thinking)59.33
8Qwen 3.6 35B A3B (Thinking)59.32
9Gemma 4 31B (IT)59.05
10Qwen 3.5 35B A3B (Thinking)58.56
11Qwen 3.6 27B (Thinking)58.5
12Qwen 3 235B A22B (Thinking)58.42
13Muse Glimmer 30B (xHigh)57.59
14Muse Glimmer 30B (High)57.43
15Qwen 3 Next 80B A3B (Thinking)56.95

Interactive version: theaggregate.ai/benchmark?slug=medmarks-verifiable · How It Works · Data refreshed daily, snapshot 2026-10-09.