Evals for Every Language - Language nus — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Claude Opus 4.751.04
2Claude Opus 4.850.47
3Claude Sonnet 4.649.1
4GPT-5.548.7
5Gemini 3.1 Pro (Preview)47.84
6Gemini 3.1 Flash Lite35.03
7GPT-5.433.64
8Gemini 2.5 Pro32.46
9DeepSeek V3.131.87
10GPT-5.130.36
11nova-2-lite-v130.36
12Claude Sonnet 4.530.28
13GPT-5.230.19
14Claude Sonnet 429.98
15Ministral 3 8B29.13

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-nus · How the rankings work · Data refreshed daily, snapshot 2026-07-22.