Evals for Every Language - Language ast — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)64.58
2Claude Sonnet 4.564.11
3Gemini 2.5 Flash63.8
4Claude Opus 4.863.78
5Claude Opus 4.763.21
6Gemini 2.5 Pro63.1
7Claude Sonnet 462.24
8Nova Pro (v1)60.61
9Claude Sonnet 4.660.53
10GPT-5.460.43
11Gemma 3 27B (IT)59.58
12DeepSeek V3.2 Exp59.41
13GPT-4o59.35
14Llama 4 Maverick58.82
15GPT-5.258.29

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-ast · How the rankings work · Data refreshed daily, snapshot 2026-07-22.