Evals for Every Language - Language lmo: leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)67.8
2Claude Opus 4.766.39
3Gemini 3.1 Flash Lite66.11
4Gemini 2.5 Pro65.68
5Claude Sonnet 465.41
6Claude Sonnet 4.665.16
7Grok 4.2065.06
8GPT-565.01
9GPT-5.364.95
10GPT-5.464.8
11Claude Sonnet 4.564.41
12Claude Opus 4.864.41
13GPT-5.264.02
14GPT-5.163.62
15GPT-5.563.48

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-lmo · How It Works · Data refreshed daily, snapshot 2026-09-05.