Evals for Every Language - Language bo — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1GPT-550.78
2Gemini 2.5 Pro45.91
3Claude Sonnet 4.544.9
4Claude Opus 4.744.7
5Gemini 3.1 Pro (Preview)42.57
6Claude Sonnet 442.18
7Gemini 2.5 Flash41.19
8GPT-5.540.93
9Claude Opus 4.840.88
10Gemini 2.5 Flash Lite40.1
11GPT-5.439.91
12Qwen 3.6 Plus38.56
13Grok 4.2038.29
14GPT-5.238.23
15Gemini 3.1 Flash Lite37.88

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-bo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.