Evals for Every Language - Language fuv — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)35.29
2Claude Opus 4.733.79
3Claude Sonnet 432.19
4GPT-5.531.26
5Gemini 2.5 Pro30.11
6GPT-5.429.08
7Claude Sonnet 4.628.59
8GPT-528.46
9Grok 4.2028.44
10Gemini 2.5 Flash28.37
11Qwen 3.6 Plus28.13
12GPT-5.227.69
13Claude Sonnet 4.527.47
14Claude Opus 4.827.21
15GPT-5 Mini27.11

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-fuv · How the rankings work · Data refreshed daily, snapshot 2026-07-22.