Evals for Every Language - Language sc — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite60
2Claude Opus 4.758.44
3Gemini 3.1 Pro (Preview)57.52
4Claude Sonnet 4.556.09
5Gemini 2.5 Flash55.96
6Gemini 2.5 Pro55.38
7Claude Sonnet 454.87
8Gemini 2.5 Flash Lite54.55
9GPT-5.454.08
10Claude Opus 4.852.53
11GPT-551.21
12Grok 4.2050.5
13GPT-5.550.43
14Llama 4 Maverick50.02
15Qwen 3.6 Plus49.26

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-sc · How the rankings work · Data refreshed daily, snapshot 2026-07-22.