MedLayXPlain: leaderboard

Metric: S (self-reported). Source: benchmarklist.com. 32 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash (Thinking)70.6
2Qwen 3 VL 32B (Thinking)65.4
3Qwen 3 VL 30B A3B (Thinking)64.8
4InternVL3-8B64.7
5Qwen 3 VL 8B (Thinking)64.6
6Claude Opus 4.764.1
7Qwen 3 VL 4B (Thinking)63.3
8Qwen 3.6 35B A3B61.5
9GPT-5.4 Mini61.2
10GPT-5.560.6
11Llama 4 Scout51.1
12Claude Haiku 4.550
13Gemma 4 31B48.4

Interactive version: theaggregate.ai/benchmark?slug=medlayxplain · How It Works · Data refreshed daily, snapshot 2026-09-05.