ArmBench-LLM - Overall: leaderboard

Metric: Mean category score (0-100; exams rescaled from 0-20). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)63.5
2GPT-5.2 Pro61.71
3Gemma 4 31B (IT)61.42
4Claude 3.7 Sonnet60.71
5Claude Sonnet 460.37
6Grok 4 Fast60.37
7Gemini 3 Pro (Preview)59.49
8Gemini 2.5 Flash58.19
9Grok 4.1 Fast57.68
10Qwen 3.5 27B57.67
11GPT-5.4 Mini56.89
12Gemini 3.1 Pro (Preview)52.2
13GLM-551.57
14Gemini 2.5 Pro50.36
15Mistral Large 350.04

Interactive version: theaggregate.ai/benchmark?slug=armbench-llm-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.