Evals for Every Language - Language mk: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)74.29
2Gemini 3.1 Flash Lite72.65
3Claude Sonnet 4.672.47
4Claude Sonnet 4.572.33
5GPT-5.572.02
6Claude Sonnet 471.74
7GPT-5.370.51
8Gemini 2.5 Pro70.48
9Qwen 3.6 Plus70.45
10GPT-4o70.44
11Claude Opus 4.770.34
12Claude Haiku 4.569.99
13GPT-569.93
14GPT-5.169.66
15Claude Opus 4.869.61

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-mk · How It Works · Data refreshed daily, snapshot 2026-09-05.