SAHARA - Cross-Lingual NLI: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 47 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)77.58
2Gemini 2.5 Pro75.48
3Gemini 2.5 Flash73.47
4Claude Sonnet 472.09
5GPT-5.6 Luna71.69
6GPT-4.169.6
7Claude Sonnet 4 (20250514)69
8GPT-5.168.39
9Qwen 3.6 27B66.79
10GPT-565.98
11Qwen 3.6 35B A3B65.79
12Gemma 3 27B (IT)65.58
13Qwen 3.5 27B64.48
14Gemma 3 12B (IT)61.09
15Llama 4 Scout Instruct59.88

Interactive version: theaggregate.ai/benchmark?slug=sahara-cross-lingual-nli · How It Works · Data refreshed daily, snapshot 2026-09-19.