Evals for Every Language - Language dv — leaderboard

Metric: Average Score (%). Source: huggingface.co. 68 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.6100
2Gemini 3.1 Pro (Preview)100
3GPT-5.5100
4Claude Opus 4.7100
5GPT-5.4100
6Qwen 3.6 Plus100
7Claude Opus 4.8100
8Gemini 3.1 Flash Lite100
9nova-2-lite-v1100
10GPT-5.296.67
11Claude Sonnet 496.67
12Grok 4.2093.33
13Claude Sonnet 4.590
14GLM 4.5 Air88.89
15Kimi K276.67

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-dv · How the rankings work · Data refreshed daily, snapshot 2026-07-22.