Evals for Every Language - Language lua — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Claude Opus 4.745.14
2Gemini 3.1 Pro (Preview)44.03
3Gemini 3.1 Flash Lite43.37
4Gemini 2.5 Pro42.32
5Claude Sonnet 4.540.54
6GPT-540.42
7GPT-5.540.24
8Gemini 2.5 Flash39.62
9Claude Sonnet 4.638.79
10GPT-5.138.1
11GPT-5.437.73
12Claude Opus 4.836.55
13Qwen 3.6 Plus34.78
14Grok 4.2034.61
15GPT-5.234.49

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-lua · How the rankings work · Data refreshed daily, snapshot 2026-07-22.