QIMMA - GAT: leaderboard

Metric: Accuracy (%, log-likelihood multiple choice). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1AIC-162.11
2Gemma 4 31B60.59
3Qwen 2.5 32B Instruct56.94
4gemma-3-27B-pt56.45
5AceGPT-v2-32B-Chat56.04
6Qwen 2.5 72B Instruct55.9
7Qwen 3.5 397B A17B55.89
8Qwen3-8B-Base55.55
9Gemma 3 27B (IT)55.05
10Gemma 4 26B A4B52.04
11Jais-2-70B-Chat51.67
12Fanar-2-27B-Instruct51.52
13AceGPT-v2-32B51.4
14Llama 3.3 70B Instruct51.13
15Qwen 3.5 122B A10B50.9

Interactive version: theaggregate.ai/benchmark?slug=qimma-gat · How It Works · Data refreshed daily, snapshot 2026-09-19.