Evals for Every Language - Language mr — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)74.38
2Grok 4.2073.46
3Claude Opus 4.772.98
4Claude Sonnet 4.672.54
5GPT-5.172.4
6GPT-5.572.25
7Gemini 3.1 Flash Lite72.09
8GPT-5.271.59
9Claude Opus 4.870.84
10Claude Sonnet 470.36
11Qwen 3.6 Plus69.53
12GPT-569.33
13Claude Sonnet 4.568.94
14Gemini 2.5 Pro68.8
15GPT-5.467.83

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-mr · How the rankings work · Data refreshed daily, snapshot 2026-07-22.