Medmarks - MedHallu Medium: leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)85.53
2GPT-5.1 (Medium)74.06
3Claude Sonnet 4.573.86
4Ling-flash-2.072.2
5Qwen 3 235B A22B (Thinking)66.67
6GLM-4.7 FP866.49
7GPT-OSS-120B (High)66.45
8GPT-OSS-20B (High)65.83
9GPT-OSS-20B (Medium)63.16
10Grok 462.63
11Hermes 4 70B62.61
12INTELLECT-362.47
13Qwen 3 VL 30B A3B (Thinking)61.86
14GPT-OSS-20B (Low)61.14
15Llama 3.1 8B Instruct60.39

Interactive version: theaggregate.ai/benchmark?slug=medmarks-medhallu-medium · How It Works · Data refreshed daily, snapshot 2026-09-05.