Medmarks - Med-HALT Reasoning FCT — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)94.56
2Grok 493.47
3GPT-5.1 (Medium)93.36
4Qwen 3 235B A22B (Thinking)90.07
5GPT-5.2 (Medium)89.98
6Claude Sonnet 4.589.73
7GPT-OSS-120B (Medium)87.96
8GPT-OSS-120B (High)87.67
9Qwen 3 Next 80B A3B (Thinking)86.86
10GPT-OSS-120B (Low)86.7
11GLM-4.7 FP886.17
12OLMo 3.1 32B (Thinking)81.91
13GPT-OSS-20B (High)80.53
14Qwen 3 30B A3B (Thinking)78.17
15GPT-OSS-20B (Medium)75.74

Interactive version: theaggregate.ai/benchmark?slug=medmarks-med-halt-reasoning-fct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.