Evals for Every Language - Language lua: leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Claude Opus 4.745.14
2Gemini 3.1 Pro (Preview)44.03
3Gemini 3.1 Flash Lite43.37
4Gemini 2.5 Pro42.32
5Claude Sonnet 4.540.54
6GPT-540.42
7GPT-5.340.3
8GPT-5.540.24
9Gemini 2.5 Flash39.62
10Claude Sonnet 4.638.79
11GPT-5.138.1
12GPT-5.437.73
13Claude Opus 4.836.55
14Qwen 3.6 Plus34.78
15Grok 4.2034.61

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-lua · How It Works · Data refreshed daily, snapshot 2026-09-05.