Evals for Every Language - Language mr: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)74.38
2Grok 4.2073.46
3GPT-5.373.44
4Claude Opus 4.772.98
5Claude Sonnet 4.672.54
6GPT-5.172.4
7GPT-5.572.25
8Gemini 3.1 Flash Lite72.09
9GPT-5.271.59
10Claude Opus 4.870.84
11Claude Sonnet 470.36
12Qwen 3.6 Plus69.53
13GPT-569.33
14Claude Sonnet 4.568.94
15Gemini 2.5 Pro68.8

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-mr · How It Works · Data refreshed daily, snapshot 2026-09-05.