Evals for Every Language - Language be — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.869.43
2Gemini 3.1 Pro (Preview)69.25
3Claude Sonnet 4.667.3
4Claude Opus 4.766.48
5GPT-5.166.18
6Mistral Medium 3.165.82
7Qwen 3.6 Plus65.74
8GPT-565.43
9Claude Sonnet 465.35
10DeepSeek V3.165.31
11GPT-4.165.21
12Claude Sonnet 4.565.07
13Gemini 3.1 Flash Lite64.94
14GPT-5.564.63
15nova-2-lite-v164.22

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-be · How the rankings work · Data refreshed daily, snapshot 2026-07-22.