ArmBench-LLM - Reading Comprehension: leaderboard

Metric: Mean of accuracy and BLEU tasks (0-100). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1GPT-5.4 Mini62.28
2GPT-5.2 Pro60.96
3Qwen 3.5 27B60.65
4Grok 4 Fast60.37
5Claude 3.7 Sonnet59.66
6Gemini 3 Pro (Preview)59.01
7Gemini 2.5 Pro58.99
8Gemma 4 31B (IT)58.43
9GLM-4.7 Flash58.17
10GPT-5.4 Nano56.47
11Gemini 3.1 Pro (Preview)54.12
12Claude Sonnet 453.25
13Gemini 3 Flash (Preview)52.54
14GLM-552.52
15Qwen 3.5 35B A3B52.08

Interactive version: theaggregate.ai/benchmark?slug=armbench-llm-reading-comprehension · How It Works · Data refreshed daily, snapshot 2026-09-19.