Evals for Every Language - Language cv: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)64.6
2Claude Opus 4.864.32
3Claude Opus 4.762.92
4Gemini 2.5 Pro61.73
5Qwen 3.6 Plus61.59
6GPT-5.360.36
7GPT-5.559.68
8Grok 4.2059.28
9GPT-5.458.98
10Claude Sonnet 4.657.59
11DeepSeek V3.155.92
12Gemini 3.1 Flash Lite55.79
13Claude Sonnet 4.555.02
14GPT-5.254.86
15Nova Pro (v1)53.81

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-cv · How It Works · Data refreshed daily, snapshot 2026-09-05.