Medmarks - MedDialog — leaderboard

Metric: Score (%). Source: medmarks.ai. 12 models tracked.

Top models

#ModelScore
1Qwen 3 235B A22B (Thinking)93.84
2GPT-5.2 (Medium)93.01
3GPT-5.1 (Medium)90.54
4GPT-OSS-120B (High)90.35
5Qwen 3 30B A3B (Thinking)88.53
6Claude Sonnet 4.587.78
7GPT-OSS-20B (High)87.23
8Qwen 3 8B (Thinking)84.94
9GLM-4.7 FP879.8
10Gemini 3 Pro (Preview)79.67

Interactive version: theaggregate.ai/benchmark?slug=medmarks-meddialog · How the rankings work · Data refreshed daily, snapshot 2026-07-22.