RABBITS MedMCQA G2B — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 26 models tracked.

Top models

#ModelScore
1GPT-3.5 Turbo97.7
2Gemini 1.5 Flash94.83
3GPT-488.79
4GPT-4o86.49
5Gemini 1.5 Pro82.47
6Claude 3 Opus79.89
7Qwen 2 72B71.55
8Llama 3 70B66.67
9Mixtral-8x22B-v0.161.78
10Phi-3-medium-4k-instruct60.34
11Yi 1.5 34B59.77
12Mixtral 8x7B (v0.1)55.46
13Qwen 2 7B55.17
14Llama 3 8B52.87
15c4ai-command-r-plus49.14

Interactive version: theaggregate.ai/benchmark?slug=rabbits-medmcqa-g2b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.