Evals for Every Language - Language de — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)77.38
2Claude Sonnet 4.577.26
3Claude Opus 4.876.71
4Gemini 2.5 Pro76.67
5Claude Sonnet 475.83
6Claude Opus 4.775.66
7Claude Sonnet 4.675.44
8Gemini 3.1 Flash Lite75.35
9Claude Haiku 4.574.81
10Grok 4.2074.64
11GPT-5.274.52
12GPT-5.174.5
13GPT-574.17
14GPT-4o73.78
15Gemma 3 27B (IT)73.48

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-de · How the rankings work · Data refreshed daily, snapshot 2026-07-22.