Evals for Every Language - Language vmw — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)43.07
2Claude Opus 4.738.07
3GPT-5.537.15
4Gemini 2.5 Pro36.03
5Gemini 3.1 Flash Lite35.99
6Claude Sonnet 4.534.2
7GPT-5.234.06
8GPT-5.431.89
9DeepSeek V3.2 Exp31.76
10Grok 4.2031.37
11Llama 3.1 70B Instruct31.28
12Gemini 2.5 Flash30.3
13Command A30.28
14Claude Sonnet 4.630.17
15GPT-529.34

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-vmw · How the rankings work · Data refreshed daily, snapshot 2026-07-22.