Evals for Every Language - Language myv — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)50.07
2Gemini 2.5 Pro49.84
3Claude Opus 4.746.27
4Claude Sonnet 4.545.99
5Claude Opus 4.845.05
6Gemini 3.1 Flash Lite44.81
7Gemini 2.5 Flash43.55
8Qwen 3.6 Plus42.59
9Claude Sonnet 4.642.43
10GPT-5.541.75
11Claude Sonnet 441.12
12DeepSeek V3.2 Exp40.01
13Gemini 2.5 Flash Lite39.19
14GPT-539.12
15GPT-5.438.35

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-myv · How the rankings work · Data refreshed daily, snapshot 2026-07-22.