Evals for Every Language - Language pt — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite77.5
2Gemini 3.1 Pro (Preview)75.55
3Claude Sonnet 4.575.39
4Claude Opus 4.875.31
5Claude Sonnet 4.674.93
6Claude Opus 4.774.77
7Claude Sonnet 474.42
8Gemini 2.5 Pro74.29
9Gemini 2.5 Flash Lite73.59
10Gemma 3 27B (IT)73.25
11GPT-5.573.02
12GPT-572.95
13Command A72.95
14Claude Haiku 4.572.61
15Nova Pro (v1)72.49

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-pt · How the rankings work · Data refreshed daily, snapshot 2026-07-22.