SeaEval - Cross-Lingual Consistency - Cross-LogiQA (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 23 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct72.48
2Qwen 2.5 32B Instruct69.32
3Qwen 2 72B Instruct67.29
4Llama 3.1 70B Instruct65.67
5Qwen 2.5 14B Instruct64.37
6Llama 3 70B Instruct63.07
7Gemma 2 9B (IT)61.85
8gemma2-9B-cpt-sea-lionv3-instruct60.55
9Qwen 2.5 7B Instruct59.9
10Qwen 2 7B Instruct56.49
11SeaLLMs-v3-7B-Chat55.52
12Sailor2-8B-Chat54.06
13Llama 3 8B Cpt Sea Lionv2.1 Instruct49.92
14Qwen 2.5 3B Instruct48.78
15Llama 3.1 8B Instruct48.62

Interactive version: theaggregate.ai/benchmark?slug=seaeval-cross-lingual-consistency-cross-logiqa-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.