Evals for Every Language - ARC — leaderboard

Metric: Average Score (%). Source: huggingface.co. 69 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)98.79
2Claude Opus 4.898
3GPT-5.597.82
4DeepSeek V3.197.4
5Claude Opus 4.797.23
6Gemini 3.1 Flash Lite96.94
7GPT-5.496.36
8Qwen 3.6 Plus95.76
9Grok 4.2095.65
10Claude Sonnet 4.695.55
11GPT-5.295.14
12GPT-593.39
13GPT-5.192.43
14Claude Sonnet 4.592.24
15Claude Sonnet 491.55

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-arc · How the rankings work · Data refreshed daily, snapshot 2026-07-22.