Evals for Every Language - Language fuv: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)35.29
2Claude Opus 4.733.79
3Claude Sonnet 432.19
4GPT-5.531.26
5Gemini 2.5 Pro30.11
6GPT-5.429.08
7Claude Sonnet 4.628.59
8GPT-528.46
9GPT-5.328.46
10Grok 4.2028.44
11Gemini 2.5 Flash28.37
12Qwen 3.6 Plus28.13
13GPT-5.227.69
14Claude Sonnet 4.527.47
15Claude Opus 4.827.21

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-fuv · How It Works · Data refreshed daily, snapshot 2026-09-05.