Evals for Every Language - Language pl — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)71.87
2Gemini 2.5 Pro71.38
3GPT-571.37
4Claude Sonnet 4.571.35
5Claude Opus 4.870.71
6GPT-5.270.13
7Claude Opus 4.770.03
8Claude Sonnet 4.669.59
9GPT-5.169.34
10Claude Sonnet 469.07
11Llama 4 Maverick68.76
12GPT-4o68.6
13Gemma 3 27B (IT)68.3
14Gemini 3.1 Flash Lite68.29
15GPT-5.568.15

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-pl · How the rankings work · Data refreshed daily, snapshot 2026-07-22.