Evals for Every Language - Language bua: leaderboard

Metric: Average Score (%). Source: huggingface.co. 68 models tracked.

Top models

#ModelScore
1GPT-5.296.67
2GPT-5.596.67
3Claude Sonnet 4.596.67
4GPT-5.496.67
5Claude Opus 4.896.67
6Qwen 3.6 Plus96.67
7GPT-593.33
8Gemini 3.1 Pro (Preview)93.33
9Grok 4.2093.33
10GLM 4.5 Air91.67
11Claude Sonnet 4.690
12GPT-5.190
13GPT-5.390
14Claude Opus 4.789.63
15Qwen 3.6 Flash89.63

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-bua · How It Works · Data refreshed daily, snapshot 2026-09-05.