Evals for Every Language - Language luo: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)64.57
2Claude Opus 4.763.26
3Claude Opus 4.862.69
4Gemini 3.1 Flash Lite59.6
5Gemini 2.5 Pro58.94
6Grok 4.2055.7
7GPT-5.554.37
8Claude Sonnet 4.550.45
9GPT-5.450.05
10GPT-5.349
11Claude Sonnet 4.647.72
12GPT-547.49
13Claude Sonnet 446.24
14GPT-5.245.51
15GPT-4o44.27

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-luo · How It Works · Data refreshed daily, snapshot 2026-09-05.