Evals for Every Language - Language nl — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite75.03
2Gemini 3.1 Pro (Preview)74.96
3Claude Opus 4.773.07
4Claude Opus 4.872.79
5Claude Sonnet 4.672.69
6Claude Sonnet 4.571.44
7Qwen 3.6 Plus71.09
8Gemini 2.5 Pro70.66
9Grok 4.2070.57
10Claude Sonnet 470.33
11Gemma 3 27B (IT)70.12
12Claude Haiku 4.569.34
13Gemini 2.5 Flash Lite69.2
14GPT-5.168.75
15Mistral Medium 3.168.71

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-nl · How the rankings work · Data refreshed daily, snapshot 2026-07-22.