Medmarks - MedHallu Medium — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)85.53
2GPT-5.1 (Medium)74.06
3Claude Sonnet 4.573.86
4Ling-flash-2.072.2
5Qwen 3 235B A22B (Thinking)66.67
6GLM-4.7 FP866.49
7GPT-OSS-120B (High)66.45
8GPT-OSS-20B (High)65.83
9GPT-OSS-20B (Medium)63.16
10Grok 462.63
11Hermes 4 70B62.61
12Qwen 3 30B A3B (Thinking)62.58
13INTELLECT-362.47
14Qwen 3 4B (Reasoning)62.12
15Qwen 3 VL 30B A3B (Thinking)61.86

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medhallu-medium · How the rankings work · Data refreshed daily, snapshot 2026-07-22.