Evals for Every Language - Language af — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)79.41
2Claude Sonnet 478.98
3Claude Opus 4.878.38
4Claude Sonnet 4.677.9
5GPT-5.177.76
6Claude Sonnet 4.577.7
7GPT-5.577.33
8Claude Opus 4.776.97
9Grok 4.2076.25
10GPT-576.24
11GPT-5.275.87
12Mistral Medium 3.175.85
13GPT-4o75.82
14DeepSeek V3.2 Exp75.2
15Gemini 2.5 Pro74.51

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-af · How the rankings work · Data refreshed daily, snapshot 2026-07-22.