MedFrameQA — leaderboard
Metric: Average Accuracy (self-reported). Source: benchmarklist.com. 11 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemini 2.5 Flash | 54.75 |
| 2 | O3 | 50.18 |
| 3 | Claude 3.7 Sonnet | 49.67 |
| 4 | O4 Mini | 49.4 |
| 5 | O1 | 47.91 |
| 6 | GPT-4 Turbo | 46.69 |
| 7 | QVQ-72B-Preview | 46.44 |
| 8 | GPT-4o | 45.67 |
| 9 | GPT-4o Mini | 34.55 |
Interactive version: theaggregate.ai/benchmark?slug=medframeqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.