ArmBench-LLM - MCQA: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1GPT-5.2 Pro98.67
2Claude Sonnet 497.33
3Claude 3.7 Sonnet96.67
4Grok 4 Fast96
5GPT-5.4 Mini94.67
6Gemini 2.5 Pro94
7Qwen 3.5 27B91.33
8Gemini 3.1 Pro (Preview)90.67
9Gemini 3 Pro (Preview)90
10Gemini 3 Flash (Preview)88.67
11Gemma 4 31B (IT)87.33
12GLM-4.7 Flash87.33
13GLM-587.33
14Gemini 2.5 Flash86
15Grok 4.1 Fast86

Interactive version: theaggregate.ai/benchmark?slug=armbench-llm-mcqa · How It Works · Data refreshed daily, snapshot 2026-09-19.