Vals AI MedQA — leaderboard

Metric: Accuracy (%). Source: www.vals.ai. 95 models tracked.

Top models

#ModelScore
1O1 (2024-12-17)96.52
2GPT-5.196.38
3Gemini 3.1 Pro (Preview)96.37
4GPT-596.32
5GPT-5.4 (2026-03-05)96.09
6GPT-5 Mini96.06
7O3 (2025-04-16)96.06
8Gemini 3 Pro (Preview)96.03
9O4 Mini (2025-04-16)96.02
10Claude Opus 4.5 (20251101) (Thinking)95.88
11Gemini 3 Flash (Preview)95.81
12Claude Opus 4.6 (Thinking)95.41
13Qwen 3.5 Plus (Thinking)95.21
14O3 Mini (2025-01-31)94.83
15Claude Sonnet 4.5 (Thinking)94.71

Interactive version: theaggregate.ai/benchmark?slug=vals-ai-medqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.