Evals for Every Language - Language luo — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)64.57
2Claude Opus 4.763.26
3Claude Opus 4.862.69
4Gemini 3.1 Flash Lite59.6
5Gemini 2.5 Pro58.94
6Grok 4.2055.7
7GPT-5.554.37
8Claude Sonnet 4.550.45
9GPT-5.450.05
10Claude Sonnet 4.647.72
11GPT-547.49
12Claude Sonnet 446.24
13GPT-5.245.51
14GPT-4o44.27
15nova-2-lite-v140.68

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-luo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.