Evals for Every Language - Language vmw: leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)43.07
2Claude Opus 4.738.07
3GPT-5.537.15
4Gemini 2.5 Pro36.03
5Gemini 3.1 Flash Lite35.99
6Claude Sonnet 4.534.2
7GPT-5.234.06
8GPT-5.431.89
9DeepSeek V3.2 Exp31.76
10GPT-5.331.52
11Grok 4.2031.37
12Llama 3.1 70B Instruct31.28
13Gemini 2.5 Flash30.3
14Command A30.28
15Claude Sonnet 4.630.17

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-vmw · How It Works · Data refreshed daily, snapshot 2026-09-05.