QIMMA - PALMX: leaderboard

Metric: Accuracy (%, log-likelihood multiple choice). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Qwen 3.5 397B A17B83.91
2Jais-2-70B-Chat83.73
3Qwen 3.5 122B A10B81.46
4Gemma 4 31B81.23
5Jais-2-8B-Chat78.98
6gemma-3-27B-pt78.62
7Llama 3.3 70B Instruct77.95
8Qwen 2.5 72B Instruct77.77
9ALLaM-7B-Instruct-preview76.84
10Gemma 4 26B A4B76.39
11AIC-176.11
12Qwen 3.5 27B75.93
13jais-adapted-70B-chat75.51
14AceGPT-v2-32B-Chat74.46
15Qwen 3.5 35B A3B74.37

Interactive version: theaggregate.ai/benchmark?slug=qimma-palmx · How It Works · Data refreshed daily, snapshot 2026-09-19.