ArmBench-LLM - MMLU-Pro: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)86.79
2GPT-5.2 Pro84.88
3Grok 4.1 Fast81.68
4Grok 4 Fast81.68
5Qwen 3.5 27B81.28
6Gemini 3 Pro (Preview)80.78
7Gemma 4 31B (IT)79.48
8Gemini 3.1 Pro (Preview)75.08
9Claude Sonnet 474.77
10Claude 3.7 Sonnet74.57
11Mistral Large 374.07
12GPT-5.4 Mini70.47
13GLM-569.47
14Qwen 3.5 35B A3B65.27
15Gemini 2.5 Flash64.16

Interactive version: theaggregate.ai/benchmark?slug=armbench-llm-mmlu-pro · How It Works · Data refreshed daily, snapshot 2026-09-19.