Evals for Every Language - Language ml — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)73.73
2Claude Sonnet 4.572.9
3GPT-5.271.8
4Claude Sonnet 471.64
5GPT-571.24
6Claude Opus 4.870.7
7Claude Sonnet 4.670.49
8Claude Opus 4.769.91
9GPT-5.169.61
10Grok 4.2069.42
11Qwen 3.6 Plus69.21
12GPT-5.569.13
13Gemini 2.5 Flash Lite67.39
14Llama 4 Maverick67.29
15GPT-5.467.18

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ml · How the rankings work · Data refreshed daily, snapshot 2026-07-22.