Evals for Every Language - Language bg — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)75.9
2Claude Sonnet 4.575.64
3GPT-5.174.89
4Claude Opus 4.774.44
5Claude Opus 4.874.44
6GPT-4o74.26
7Claude Sonnet 4.674.14
8Gemini 2.5 Pro74.04
9Claude Sonnet 473.99
10Gemma 3 27B (IT)73.9
11Qwen 3.6 Plus72.97
12Mistral Medium 3.172.84
13GPT-572.56
14Claude Haiku 4.571.97
15Nova Pro (v1)71.92

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-bg · How the rankings work · Data refreshed daily, snapshot 2026-07-22.