Evals for Every Language - Language el — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite73.81
2Gemini 3.1 Pro (Preview)72.7
3Gemma 3 27B (IT)72.48
4Nova Pro (v1)72.17
5Claude Sonnet 471.65
6GPT-5.571.64
7GPT-5.171.61
8Claude Opus 4.771.56
9Claude Sonnet 4.571.34
10DeepSeek V3.170.9
11GPT-570.64
12Claude Sonnet 4.670.55
13Claude Opus 4.870.34
14Grok 4.2069.86
15Mistral Medium 3.169.56

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-el · How the rankings work · Data refreshed daily, snapshot 2026-07-22.