Evals for Every Language - Language hy: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.570.28
2Gemini 3.1 Pro (Preview)70.17
3Claude Sonnet 4.669.93
4GPT-569.71
5Claude Sonnet 469.32
6Nova Pro (v1)68.85
7Claude Opus 4.768.76
8GPT-5.368.68
9Qwen 3.6 Plus68.34
10Claude Opus 4.868.32
11GPT-5.567.74
12DeepSeek V3.167.69
13Qwen 3.6 Flash67.55
14Grok 4.2067.5
15GPT-5.267.44

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-hy · How It Works · Data refreshed daily, snapshot 2026-09-05.