Evals for Every Language - Language bm — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)60.7
2Claude Opus 4.859.47
3Claude Opus 4.758.41
4GPT-5.554.72
5Gemini 2.5 Pro50.87
6Qwen 3.6 Plus50.12
7Gemini 3.1 Flash Lite47.73
8GPT-5.447.03
9Claude Sonnet 4.647.02
10Grok 4.2044.67
11GPT-5.240.47
12Claude Sonnet 4.539.02
13GPT-5.137.92
14GPT-536.96
15Llama 4 Maverick36.8

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-bm · How the rankings work · Data refreshed daily, snapshot 2026-07-22.