Evals for Every Language - Language yua — leaderboard

Metric: Average Score (%). Source: huggingface.co. 69 models tracked.

Top models

#ModelScore
1Claude Opus 4.7100
2DeepSeek V3.1100
3Gemini 3.1 Flash Lite100
4Gemini 3.1 Pro (Preview)96.67
5GPT-5.596.67
6Claude Opus 4.890
7Claude Sonnet 4.586.67
8jamba-large-1.786.67
9Claude Sonnet 4.685.19
10GPT-5.283.33
11GPT-5.483.33
12Claude Sonnet 483.33
13Qwen 3.6 Plus83.33
14Kimi K283.33
15Grok 4.2083.33

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-yua · How the rankings work · Data refreshed daily, snapshot 2026-07-22.