ArmBench-LLM - NER: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1GPT-5.2 Pro78.35
2Grok 4 Fast75.92
3Mistral Large 375.62
4Claude 3.7 Sonnet74.59
5Claude Sonnet 474.28
6Gemini 3 Flash (Preview)73.61
7Gemini 2.5 Flash73.6
8Grok 4.1 Fast73.52
9Qwen 3.5 27B72.46
10Gemma 4 31B (IT)71.69
11Gemma 3 12B (IT)70.2
12Grok 4.2069.61
13Ministral 3 14B69.44
14Gemma 3 27B (IT)68.97
15GPT-5.4 Mini68.89

Interactive version: theaggregate.ai/benchmark?slug=armbench-llm-ner · How It Works · Data refreshed daily, snapshot 2026-09-19.