Evals for Every Language - Classification — leaderboard

Metric: Average Score (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro98.87
2Claude Sonnet 4.598.87
3Gemini 3.1 Pro (Preview)98.25
4Claude Sonnet 497.84
5GPT-4o96.86
6GPT-596.75
7Claude Opus 4.795.98
8GPT-5.195.98
9Gemini 3.1 Flash Lite95.5
10Gemma 3 27B (IT)95.41
11Command A95.36
12Nova Pro (v1)95.21
13Mistral Medium 3.194.48
14GPT-3.5 Turbo92.22
15jamba-large-1.791.29

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-classification · How the rankings work · Data refreshed daily, snapshot 2026-07-22.