Evals for Every Language - Language mni — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)49.55
2Gemini 2.5 Pro48.21
3GPT-5.543.54
4Claude Opus 4.841.87
5Claude Opus 4.741.68
6Gemini 3.1 Flash Lite41.07
7GPT-5.439.45
8Gemini 2.5 Flash39.43
9Qwen 3.6 Plus36.05
10Claude Sonnet 435.27
11Claude Sonnet 4.634.97
12Claude Sonnet 4.533.33
13Grok 4.2033.2
14Gemini 2.5 Flash Lite32.86
15GPT-532.32

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-mni · How the rankings work · Data refreshed daily, snapshot 2026-07-22.