Evals for Every Language - Language mk — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)74.29
2Gemini 3.1 Flash Lite72.65
3Claude Sonnet 4.672.47
4Claude Sonnet 4.572.33
5GPT-5.572.02
6Claude Sonnet 471.74
7Gemini 2.5 Pro70.48
8Qwen 3.6 Plus70.45
9GPT-4o70.44
10Claude Opus 4.770.34
11Claude Haiku 4.569.99
12GPT-569.93
13GPT-5.169.66
14Claude Opus 4.869.61
15Nova Pro (v1)69.17

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-mk · How the rankings work · Data refreshed daily, snapshot 2026-07-22.