Medmarks - Med-HALT Reasoning NOTA — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Qwen 3 Next 80B A3B (Thinking)78.86
2Grok 478.54
3Gemini 3 Pro (Preview)74.4
4Qwen 3 14B (Reasoning)73.78
5OLMo 3.1 32B (Thinking)72.07
6GPT-5.1 (Medium)69.85
7GPT-5.2 (Medium)69.75
8GLM-4.7 FP869
9Qwen 2.5 32B Instruct68.78
10Qwen 3 235B A22B (Thinking)68.29
11Qwen 3 8B (Thinking)67.8
12Qwen 3 30B A3B (Thinking)67.19
13Qwen 3 VL 30B A3B (Thinking)66.97
14OLMo 3 32B (Thinking)63.53
15Ling-flash-2.061.51

Interactive version: theaggregate.ai/benchmark?slug=medmarks-med-halt-reasoning-nota · How the rankings work · Data refreshed daily, snapshot 2026-07-22.