ArmBench-LLM - Text Processing: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1GPT-5.2 Pro87.91
2Gemini 2.5 Flash85.63
3Gemma 4 31B (IT)83.69
4Gemini 3 Flash (Preview)83.57
5GPT-5.4 Mini81.38
6Mistral Large 381.17
7Claude 3.7 Sonnet80.92
8Grok 4 Fast77.88
9Claude Sonnet 476.77
10Grok 4.1 Fast76.61
11Mistral Small 3.276.5
12GPT-5.4 Nano76.31
13Gemma 3 27B (IT)76.17
14Gemini 3 Pro (Preview)76.02
15Qwen 3.5 27B73.2

Interactive version: theaggregate.ai/benchmark?slug=armbench-llm-text-processing · How It Works · Data refreshed daily, snapshot 2026-09-19.