LLMEval-Fair - Medicine: leaderboard

Metric: Discipline Score (0-10). Source: github.com. 59 models tracked.

Top models

#ModelScore
1DeepSeek V38.83
2Qwen 3 235B A22B8.73
3QwQ-32B8.57
4Kimi K28.53
5DeepSeek V3.28.53
6GPT-58.5
7DeepSeek R18.5
8Gemini 2.5 Pro (Preview)8.5
9GLM-4.68.43
10Claude Sonnet 4.5 (Thinking)8.27
11GPT-4o Search Preview8.27
12GLM-4 32B8.23
13Claude Sonnet 48.17
14O1 (2024-12-17)8.17
15Claude Sonnet 4.58.13

Interactive version: theaggregate.ai/benchmark?slug=llmeval-fair-medicine · How It Works · Data refreshed daily, snapshot 2026-09-19.