Evals for Every Language - Language cs — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.774.38
2Gemini 3.1 Pro (Preview)73.9
3Claude Opus 4.873.8
4Claude Sonnet 4.573.09
5Claude Sonnet 4.672.97
6Mistral Medium 3.172.35
7Claude Sonnet 472.28
8Gemini 2.5 Pro72.27
9Gemini 3.1 Flash Lite72.24
10GPT-5.571.8
11GPT-5.171.22
12Qwen 3.6 Plus71.06
13GPT-570.51
14GPT-5.270.25
15GPT-5.470.13

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-cs · How the rankings work · Data refreshed daily, snapshot 2026-07-22.