Evals for Every Language - Language mfe: leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)57.05
2Claude Sonnet 4.655.76
3GPT-555.55
4GPT-5.455.54
5GPT-5.154.82
6Gemini 2.5 Pro54.56
7Gemini 2.5 Flash54.54
8Claude Opus 4.754.32
9Claude Opus 4.853.48
10Claude Sonnet 4.552.35
11Grok 4.2051.86
12Qwen 3.6 Plus51.57
13GPT-5.351.49
14GPT-5.250.87
15Gemini 3.1 Flash Lite50.68

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-mfe · How It Works · Data refreshed daily, snapshot 2026-09-05.