Evals for Every Language - Language fil — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)67.25
2GPT-4o66.8
3Gemini 2.5 Pro66.71
4Claude Sonnet 4.666.54
5Claude Opus 4.865.99
6Claude Sonnet 465.91
7GPT-5.165.52
8Claude Sonnet 4.565.34
9Gemini 3.1 Flash Lite65.09
10Llama 3.1 70B Instruct64.31
11DeepSeek V3.2 Exp64.3
12Kimi K263.5
13GPT-5.563.27
14Gemma 3 27B (IT)63.2
15GPT-562.81

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-fil · How the rankings work · Data refreshed daily, snapshot 2026-07-22.