Evals for Every Language - Language zh: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)70.53
2Claude Sonnet 468.85
3Claude Sonnet 4.568.53
4Claude Sonnet 4.667.58
5GPT-567.57
6Gemini 2.5 Pro67.47
7Command A67.23
8GPT-5.267.04
9Grok 4.2066.96
10Gemini 3.1 Flash Lite66.89
11GPT-5.366.88
12jamba-large-1.766.73
13Mistral Medium 3.166.61
14GPT-4o66.46
15Kimi K266.14

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-zh · How It Works · Data refreshed daily, snapshot 2026-09-05.