Evals for Every Language - Language bjn — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)50.24
2Gemini 2.5 Pro49.79
3Gemini 3.1 Flash Lite49.28
4Claude Opus 4.748.88
5Claude Sonnet 4.547.53
6Claude Opus 4.847.35
7Claude Sonnet 445.73
8Qwen 3.6 Plus45.34
9GPT-544.92
10Gemini 2.5 Flash Lite44.38
11GPT-5.544.06
12GPT-5.143.34
13Gemini 2.5 Flash43.28
14Mistral Medium 3.143.12
15Llama 3.1 70B Instruct42.91

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-bjn · How the rankings work · Data refreshed daily, snapshot 2026-07-22.