MedBench v5 - Medical Atomic Skills: leaderboard

Metric: Medical Atomic Skills average (0-100): macro-average of the DataAgent, RAGAgent, DeepResearch and SafetyAgent executable agent environment scores; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 4 models tracked.

Top models

#ModelScore
1GPT-5.581.22
2Kimi K2.674.49
3Seed 2.0 Pro74.1

Interactive version: theaggregate.ai/benchmark?slug=medbench-v5-medical-atomic-skills · How It Works · Data refreshed daily, snapshot 2026-09-29.