Evals for Every Language - Language zh — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)70.53
2Claude Sonnet 468.85
3Claude Sonnet 4.568.53
4Claude Sonnet 4.667.58
5GPT-567.57
6Gemini 2.5 Pro67.47
7Command A67.23
8GPT-5.267.04
9Grok 4.2066.96
10Gemini 3.1 Flash Lite66.89
11jamba-large-1.766.73
12Mistral Medium 3.166.61
13GPT-4o66.46
14Kimi K266.14
15nova-2-lite-v166.08

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-zh · How the rankings work · Data refreshed daily, snapshot 2026-07-22.