Evals for Every Language - Language pt: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite77.5
2Gemini 3.1 Pro (Preview)75.55
3Claude Sonnet 4.575.39
4Claude Opus 4.875.31
5Claude Sonnet 4.674.93
6Claude Opus 4.774.77
7Claude Sonnet 474.42
8Gemini 2.5 Pro74.29
9GPT-5.374.22
10Gemini 2.5 Flash Lite73.59
11Gemma 3 27B (IT)73.25
12GPT-5.573.02
13GPT-572.95
14Command A72.95
15Claude Haiku 4.572.61

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-pt · How It Works · Data refreshed daily, snapshot 2026-09-05.