Evals for Every Language - Language lmo — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)67.8
2Claude Opus 4.766.39
3Gemini 3.1 Flash Lite66.11
4Gemini 2.5 Pro65.68
5Claude Sonnet 465.41
6Claude Sonnet 4.665.16
7Grok 4.2065.06
8GPT-565.01
9GPT-5.464.8
10Claude Sonnet 4.564.41
11Claude Opus 4.864.41
12GPT-5.264.02
13GPT-5.163.62
14GPT-5.563.48
15Qwen 3.6 Plus63.39

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-lmo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.