Evals for Every Language - Language co: leaderboard

Metric: Average Score (%). Source: huggingface.co. 69 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.6100
2Gemini 3.1 Pro (Preview)100
3Claude Opus 4.7100
4Claude Opus 4.8100
5Claude Haiku 4.5100
6DeepSeek V3.1100
7Mistral Medium 3.1100
8Gemini 3.1 Flash Lite100
9nova-2-lite-v1100
10jamba-large-1.7100
11GPT-596.67
12GPT-5.296.67
13GPT-5.596.67
14Claude Sonnet 4.596.67
15Llama 3.1 70B Instruct96.67

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-co · How It Works · Data refreshed daily, snapshot 2026-09-05.