Evals for Every Language - Language gu — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)71.19
2Claude Opus 4.769.55
3Gemini 2.5 Pro69.1
4Claude Sonnet 4.668.47
5GPT-5.168.42
6GPT-568.14
7Grok 4.2068.11
8Claude Sonnet 468.06
9Claude Sonnet 4.567.88
10GPT-4o67.79
11Claude Opus 4.867.5
12Gemini 3.1 Flash Lite67.19
13Qwen 3.6 Plus67.12
14GPT-5.567.07
15GPT-5.266.78

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-gu · How the rankings work · Data refreshed daily, snapshot 2026-07-22.