Evals for Every Language - Language ja — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)71.18
2Grok 4.2070.46
3Gemini 2.5 Pro70.44
4Gemini 3.1 Flash Lite70.37
5Claude Opus 4.770.27
6Claude Sonnet 4.570.02
7Claude Sonnet 4.669.3
8Claude Sonnet 469.13
9GPT-4o68.85
10Kimi K268.78
11GPT-568.42
12Llama 4 Maverick68.13
13GPT-5.267.95
14GPT-5.567.27
15DeepSeek V3.167.19

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ja · How the rankings work · Data refreshed daily, snapshot 2026-07-22.