Evals for Every Language - Language vai — leaderboard

Metric: Average Score (%). Source: huggingface.co. 61 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)33.33
2Mistral Small 3.225
3GPT-OSS-20B25
4DeepSeek V3.2 Exp25
5GPT-OSS-120B20
6Command A20
7GPT-4.110
8GPT-5 Nano10
9Llama 4 Maverick10
10Mistral Medium 3.110
11Gemini 2.5 Pro0
12GPT-4o0
13Gemma 3 27B (IT)0
14Llama 3.3 70B Instruct0
15GPT-50

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-vai · How the rankings work · Data refreshed daily, snapshot 2026-07-22.