Evals for Every Language - Language mt — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)80.02
2Claude Sonnet 4.578.31
3Gemini 3.1 Flash Lite77.23
4Claude Sonnet 476.66
5GPT-576.42
6Claude Opus 4.776.01
7GPT-5.175.02
8Claude Sonnet 4.674.81
9Gemini 2.5 Pro74.48
10GPT-5.574.41
11Claude Opus 4.873.71
12DeepSeek V3.172.93
13GPT-5.472.79
14GPT-4.172.76
15Qwen 3.6 Plus72.34

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-mt · How the rankings work · Data refreshed daily, snapshot 2026-07-22.