Evals for Every Language - Language vec: leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro54.06
2Gemini 3.1 Flash Lite53.71
3Gemini 3.1 Pro (Preview)53.09
4Gemini 2.5 Flash53.09
5Claude Opus 4.752.38
6GPT-551.65
7Claude Sonnet 4.651.48
8Claude Sonnet 4.551.1
9Claude Sonnet 451.01
10GPT-5.551
11GPT-5.350.57
12GPT-5.150.4
13Grok 4.2050.27
14GPT-4o49.49
15GPT-5.449.09

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-vec · How It Works · Data refreshed daily, snapshot 2026-09-05.