QIMMA - MizanQA: leaderboard

Metric: Normalized multiple-choice probability score (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Qwen 3.5 397B A17B73.36
2Jais-2-70B-Chat71.78
3Llama 3.3 70B Instruct67.44
4Qwen 3.5 27B65.18
5Gemma 4 31B (IT)64.02
6Qwen 3.5 122B A10B64.01
7AceGPT-v2-32B-Chat63.89
8Qwen 2.5 72B Instruct63.49
9Gemma 3 27B (IT)61.65
10Jais-2-8B-Chat61.33
11c4ai-command-r7B-arabic-02-202559.98
12Qwen 3.6 35B A3B59.4
13Qwen 2.5 7B Instruct58.91
14Qwen 3.5 35B A3B58.68
15Qwen 3 30B A3B 2507 Instruct58.4

Interactive version: theaggregate.ai/benchmark?slug=qimma-mizanqa · How It Works · Data refreshed daily, snapshot 2026-09-19.