Evals for Every Language - Language chm — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.763.6
2Claude Opus 4.863.17
3Gemini 3.1 Pro (Preview)62.13
4Gemini 3.1 Flash Lite61.74
5Claude Sonnet 4.660.2
6Qwen 3.6 Plus59.82
7GPT-5.458.76
8GPT-5.558.46
9Gemini 2.5 Pro57.88
10Grok 4.2055.27
11Claude Sonnet 4.554.88
12nova-2-lite-v152.92
13Claude Sonnet 449.55
14GPT-5.249.42
15GLM 4.5 Air47.52

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-chm · How the rankings work · Data refreshed daily, snapshot 2026-07-22.