Medmarks - LongHealth Task 1 — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)91.33
2GLM-4.7 FP891.17
3Claude Sonnet 4.590.92
4GPT-5.1 (Medium)90.83
5Qwen 3 235B A22B (Thinking)90.67
6Grok 490.42
7GPT-OSS-120B (High)89.33
8Qwen 3 Next 80B A3B (Thinking)89.25
9GPT-5.2 (Medium)89.08
10MiniMax-M288.92
11MiniMax-M2.188.83
12INTELLECT-388.67
13GPT-OSS-20B (Medium)88.33
14GPT-OSS-120B (Medium)88.33
15Qwen 3 14B (Reasoning)88.25

Interactive version: theaggregate.ai/benchmark?slug=medmarks-longhealth-task-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.