Evals for Every Language - Language af: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)79.41
2Claude Sonnet 478.98
3Claude Opus 4.878.38
4Claude Sonnet 4.677.9
5GPT-5.177.76
6Claude Sonnet 4.577.7
7GPT-5.577.33
8Claude Opus 4.776.97
9Grok 4.2076.25
10GPT-576.24
11GPT-5.376.11
12GPT-5.275.87
13Mistral Medium 3.175.85
14GPT-4o75.82
15DeepSeek V3.2 Exp75.2

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-af · How It Works · Data refreshed daily, snapshot 2026-09-05.