Medmarks - CareQA EN — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)96.8
2Grok 495.07
3GPT-5.1 (Medium)94.91
4GPT-5.2 (Medium)94.69
5GLM-4.7 FP894.35
6Claude Sonnet 4.593.54
7Qwen 3 235B A22B (Thinking)93.13
8Qwen 3 Next 80B A3B (Thinking)92.14
9MiniMax-M2.191.84
10Qwen 3 Next 80B A3B Instruct91.61
11MiniMax-M291.34
12GPT-OSS-120B (High)90.77
13INTELLECT-390.65
14GPT-OSS-120B (Medium)90.19
15Qwen 3 VL 30B A3B (Thinking)90.11

Interactive version: theaggregate.ai/benchmark?slug=medmarks-careqa-en · How the rankings work · Data refreshed daily, snapshot 2026-07-22.