Evals for Every Language - Language cv — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)64.6
2Claude Opus 4.864.32
3Claude Opus 4.762.92
4Gemini 2.5 Pro61.73
5Qwen 3.6 Plus61.59
6GPT-5.559.68
7Grok 4.2059.28
8GPT-5.458.98
9Claude Sonnet 4.657.59
10DeepSeek V3.155.92
11Gemini 3.1 Flash Lite55.79
12Claude Sonnet 4.555.02
13GPT-5.254.86
14Nova Pro (v1)53.81
15nova-2-lite-v153.69

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-cv · How the rankings work · Data refreshed daily, snapshot 2026-07-22.