Evals for Every Language - Language bn: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)73.32
2Claude Sonnet 473.06
3GPT-5.372.38
4Claude Opus 4.772.35
5GPT-5.272.14
6Gemini 3.1 Flash Lite72.12
7Claude Sonnet 4.671.48
8GPT-571.35
9Grok 4.2071.1
10Gemini 2.5 Pro71.06
11Claude Sonnet 4.570.61
12Claude Opus 4.870.4
13GPT-5.170.14
14GPT-5.569.73
15Qwen 3.6 Plus69.52

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-bn · How It Works · Data refreshed daily, snapshot 2026-09-05.