Evals for Every Language - Language mfe — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)57.05
2Claude Sonnet 4.655.76
3GPT-555.55
4GPT-5.455.54
5GPT-5.154.82
6Gemini 2.5 Pro54.56
7Gemini 2.5 Flash54.54
8Claude Opus 4.754.32
9Claude Opus 4.853.48
10Claude Sonnet 4.552.35
11Grok 4.2051.86
12Qwen 3.6 Plus51.57
13GPT-5.250.87
14Gemini 3.1 Flash Lite50.68
15Claude Sonnet 450.34

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-mfe · How the rankings work · Data refreshed daily, snapshot 2026-07-22.