QIMMA - AraTrust: leaderboard
Metric: Accuracy (%, log-likelihood multiple choice). Source: huggingface.co. 83 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | AIC-1 | 90.61 |
| 2 | Jais-2-70B-Chat | 90.23 |
| 3 | Qwen 3.5 397B A17B | 90.04 |
| 4 | Gemma 4 31B | 90.04 |
| 5 | gemma-3-27B-pt | 89.08 |
| 6 | Hala-9B | 88.89 |
| 7 | Qwen 2.5 72B Instruct | 88.51 |
| 8 | Fanar-1-9B-Instruct | 88.51 |
| 9 | Jais-2-8B-Chat | 87.55 |
| 10 | gemma-3-12B-pt | 87.36 |
| 11 | Yehia-7B-preview | 87.36 |
| 12 | Qwen 3.5 122B A10B | 86.97 |
| 13 | AceGPT-v2-32B-Chat | 86.97 |
| 14 | Qwen 3.5 27B | 86.59 |
| 15 | Gemma 3 12B (IT) | 86.21 |
Interactive version: theaggregate.ai/benchmark?slug=qimma-aratrust · How It Works · Data refreshed daily, snapshot 2026-09-19.