Evals for Every Language - Language co — leaderboard

Metric: Average Score (%). Source: huggingface.co. 69 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.6100
2Gemini 3.1 Pro (Preview)100
3Claude Opus 4.7100
4Claude Haiku 4.5100
5Claude Opus 4.8100
6DeepSeek V3.1100
7Mistral Medium 3.1100
8Gemini 3.1 Flash Lite100
9nova-2-lite-v1100
10jamba-large-1.7100
11GPT-596.67
12GPT-5.296.67
13Llama 3.1 70B Instruct96.67
14Claude Sonnet 4.596.67
15GPT-5 Mini96.67

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-co · How the rankings work · Data refreshed daily, snapshot 2026-07-22.