Evals for Every Language - Language bs: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)77.42
2GPT-574.87
3GPT-5.274.64
4GPT-5.374.27
5Claude Opus 4.874
6Claude Sonnet 4.573.84
7Claude Sonnet 4.673.32
8GPT-5.173.08
9Gemini 2.5 Pro72.6
10GPT-5.471.53
11Claude Sonnet 471.48
12GPT-5.571.46
13DeepSeek V3.171.17
14GPT-4.171.13
15Mistral Medium 3.171.11

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-bs · How It Works · Data refreshed daily, snapshot 2026-09-05.