Evals for Every Language - Language sc: leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite60
2Claude Opus 4.758.44
3Gemini 3.1 Pro (Preview)57.52
4Claude Sonnet 4.556.09
5Gemini 2.5 Flash55.96
6Gemini 2.5 Pro55.38
7Claude Sonnet 454.87
8Gemini 2.5 Flash Lite54.55
9GPT-5.454.08
10Claude Opus 4.852.53
11GPT-5.351.49
12GPT-551.21
13Grok 4.2050.5
14GPT-5.550.43
15Llama 4 Maverick50.02

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-sc · How It Works · Data refreshed daily, snapshot 2026-09-05.