Evals for Every Language - Language mt: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)80.02
2Claude Sonnet 4.578.31
3Gemini 3.1 Flash Lite77.23
4Claude Sonnet 476.66
5GPT-576.42
6Claude Opus 4.776.01
7GPT-5.175.02
8GPT-5.374.88
9Claude Sonnet 4.674.81
10Gemini 2.5 Pro74.48
11GPT-5.574.41
12Claude Opus 4.873.71
13DeepSeek V3.172.93
14GPT-5.472.79
15GPT-4.172.76

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-mt · How It Works · Data refreshed daily, snapshot 2026-09-05.