QIMMA - MedAraBench: leaderboard

Metric: Accuracy (%, log-likelihood multiple choice). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Llama 3.3 70B Instruct54.86
2Gemma 4 31B54.5
3Qwen 3.5 122B A10B52.49
4Jais-2-70B-Chat50.89
5AIC-150.78
6Fanar-1-9B-Instruct48.53
7Qwen 3.5 397B A17B47.97
8Gemma 4 26B A4B47.77
9Hala-9B47.54
10AceGPT-v2-32B-Chat47.32
11Qwen 3.5 35B A3B46.46
12Qwen 2.5 72B Instruct44.19
13gemma-3-27B-pt43.72
14Fanar-2-27B-Instruct42.31
15Jais-2-8B-Chat41.25

Interactive version: theaggregate.ai/benchmark?slug=qimma-medarabench · How It Works · Data refreshed daily, snapshot 2026-09-19.