EVALITA - text-entailment — leaderboard

Metric: CPS. Source: huggingface.co. 48 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct85.07
2Qwen2.5-14B-Instruct-1M85.02
3calme-3.2-instruct-78B84.31
4Qwen 2.5 VL 32B Instruct83.7
5Qwen 2.5 7B Instruct83.65
6Mistral Small 382
7Gemma 3 27B (IT)81.13
8Mistral Large 2 (Nov) Instruct (2411)80.96
9Llama 3.3 70B Instruct80.79
10Gemma 2 9B (IT)79.97
11GLM-4.1V-9B (Thinking)79.79
12Gemma 3 12B (IT)79.52
13DeepSeek R1 Distill Llama 70B79.37
14Gemma 2 27B (IT)78.72
15Qwen 2.5 VL 7B Instruct78.23

Interactive version: theaggregate.ai/benchmark?slug=evalita-text-entailment · How the rankings work · Data refreshed daily, snapshot 2026-07-22.