Evals for Every Language - Language so: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.769.48
2Claude Opus 4.869.43
3Gemini 3.1 Pro (Preview)69.39
4Claude Sonnet 4.568.12
5GPT-4o67.55
6GPT-5.266.8
7GPT-5.366.66
8Grok 4.2066.6
9Claude Sonnet 4.666.54
10GPT-5.166.14
11GPT-565.71
12Gemini 3.1 Flash Lite65.44
13Qwen 3.6 Plus65.41
14GPT-5.565.36
15GPT-4.165.28

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-so · How It Works · Data refreshed daily, snapshot 2026-09-05.