Evals for Every Language - Language nl: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Flash Lite75.03
2Gemini 3.1 Pro (Preview)74.96
3Claude Opus 4.773.07
4Claude Opus 4.872.79
5Claude Sonnet 4.672.69
6Claude Sonnet 4.571.44
7Qwen 3.6 Plus71.09
8GPT-5.370.84
9Gemini 2.5 Pro70.66
10Grok 4.2070.57
11Claude Sonnet 470.33
12Gemma 3 27B (IT)70.12
13Claude Haiku 4.569.34
14Gemini 2.5 Flash Lite69.2
15GPT-5.168.75

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-nl · How It Works · Data refreshed daily, snapshot 2026-09-05.