Medmarks - CareQA Open — leaderboard

Metric: Score (%). Source: medmarks.ai. 12 models tracked.

Top models

#ModelScore
1GPT-5.1 (Medium)89.02
2GPT-5.2 (Medium)88.62
3Claude Sonnet 4.587.61
4GLM-4.7 FP883.25
5Gemini 3 Pro (Preview)82
6GPT-OSS-120B (High)79.72
7Qwen 3 235B A22B (Thinking)76.05
8GPT-OSS-20B (High)75.18
9Qwen 3 30B A3B (Thinking)67.33
10Qwen 3 8B (Thinking)59.76

Interactive version: theaggregate.ai/benchmark?slug=medmarks-careqa-open · How the rankings work · Data refreshed daily, snapshot 2026-07-22.