Evals for Every Language - Language de: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)77.38
2Claude Sonnet 4.577.26
3Claude Opus 4.876.71
4Gemini 2.5 Pro76.67
5Claude Sonnet 475.83
6Claude Opus 4.775.66
7Claude Sonnet 4.675.44
8Gemini 3.1 Flash Lite75.35
9GPT-5.375.05
10Claude Haiku 4.574.81
11Grok 4.2074.64
12GPT-5.274.52
13GPT-5.174.5
14GPT-574.17
15GPT-4o73.78

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-de · How It Works · Data refreshed daily, snapshot 2026-09-05.