ArmBench-LLM - Translation: leaderboard

Metric: BLEU (0-100). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)31.1
2Gemma 4 31B (IT)28.39
3Claude Sonnet 427.82
4GPT-5.4 Mini20.21
5Gemini 2.5 Flash19.9
6GPT-5.2 Pro19.84
7Grok 4.1 Fast19.4
8Gemini 3 Pro (Preview)18.92
9Gemini 3.1 Pro (Preview)18.57
10Grok 4 Fast18.17
11Claude 3.7 Sonnet18.06
12Gemini 2.5 Pro16.69
13GPT-5.4 Nano15.97
14GLM-514.11
15GLM-4.7 Flash13.83

Interactive version: theaggregate.ai/benchmark?slug=armbench-llm-translation · How It Works · Data refreshed daily, snapshot 2026-09-19.