RABBITS MedMCQA Original — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 26 models tracked.

Top models

#ModelScore
1GPT-3.5 Turbo98.28
2Gemini 1.5 Flash97.41
3GPT-491.67
4GPT-4o90.52
5Gemini 1.5 Pro86.49
6Claude 3 Opus86.49
7Llama 3 70B78.16
8Qwen 2 72B77.87
9Phi-3-medium-4k-instruct72.41
10Mixtral-8x22B-v0.170.4
11Yi 1.5 34B69.25
12Mixtral 8x7B (v0.1)64.94
13Qwen 2 7B63.51
14c4ai-command-r-plus61.49
15Llama 3 8B59.2

Interactive version: theaggregate.ai/benchmark?slug=rabbits-medmcqa-original · How the rankings work · Data refreshed daily, snapshot 2026-07-22.