QIMMA - MedArabiQ MCQ: leaderboard

Metric: Accuracy (%, log-likelihood multiple choice). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Gemma 4 31B58.27
2Llama 3.3 70B Instruct58.22
3Qwen 3.5 35B A3B54.29
4AIC-152.56
5Qwen 3.5 397B A17B52.27
6Qwen 3.5 122B A10B51.93
7Jais-2-70B-Chat50.91
8gemma-3-27B-pt49.23
9Fanar-2-27B-Instruct48.24
10Gemma 4 26B A4B47.58
11Fanar-1-9B-Instruct46.53
12AceGPT-v2-32B-Chat45.88
13Qwen 2.5 72B Instruct45.58
14Hala-9B44.55
15Fanar-1-9B43.89

Interactive version: theaggregate.ai/benchmark?slug=qimma-medarabiq-mcq · How It Works · Data refreshed daily, snapshot 2026-09-19.