ArmBench-LLM - Classification: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1GLM-564.57
2Claude 3.7 Sonnet64.43
3Gemma 4 31B (IT)64.29
4Gemini 3 Pro (Preview)64.14
5Gemini 3.1 Pro (Preview)63.96
6Gemini 2.5 Pro63.86
7Gemini 3 Flash (Preview)63.79
8GPT-5.4 Nano62.14
9Qwen 3.5 27B61.21
10GLM-4.7 Flash59.86
11Claude Sonnet 459.82
12Gemma 3 12B (IT)59.71
13Gemini 2.5 Flash59.54
14Qwen 3.5 35B A3B59.5
15Ministral 3 14B59.07

Interactive version: theaggregate.ai/benchmark?slug=armbench-llm-classification · How It Works · Data refreshed daily, snapshot 2026-09-19.