Evals for Every Language - Language bs — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)77.42
2GPT-574.87
3GPT-5.274.64
4Claude Opus 4.874
5Claude Sonnet 4.573.84
6Claude Sonnet 4.673.32
7GPT-5.173.08
8Gemini 2.5 Pro72.6
9GPT-5.471.53
10Claude Sonnet 471.48
11GPT-5.571.46
12DeepSeek V3.171.17
13GPT-4.171.13
14Mistral Medium 3.171.11
15Gemini 3.1 Flash Lite70.95

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-bs · How the rankings work · Data refreshed daily, snapshot 2026-07-22.