Evals for Every Language - Language dar — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Claude Opus 4.743.4
2Gemini 3.1 Pro (Preview)42.54
3Gemini 2.5 Pro42.49
4Gemini 3.1 Flash Lite40.6
5Claude Sonnet 4.538.66
6Gemini 2.5 Flash36.84
7GPT-5.436.04
8Claude Sonnet 4.634.18
9GPT-5.534.18
10Claude Opus 4.833.01
11GPT-532.21
12Claude Sonnet 432
13GPT-5.231.2
14Mistral Medium 3.131.04
15Qwen 3.6 Plus30.35

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-dar · How the rankings work · Data refreshed daily, snapshot 2026-07-22.