SeaEval - Cross-Lingual Consistency - Cross-XQuAD (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 21 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct96.83
2Llama 3.1 70B Instruct96.16
3Qwen 2 72B Instruct96.13
4Llama 3 70B Instruct95.92
5Qwen 2.5 14B Instruct95.82
6gemma2-9B-cpt-sea-lionv3-instruct95.74
7Gemma 2 9B (IT)95.67
8Qwen 2.5 7B Instruct94.6
9Qwen 2 7B Instruct94.18
10SeaLLMs-v3-7B-Chat94.03
11Llama 3.1 8B Instruct93.8
12Qwen 2.5 3B Instruct93.78
13Llama 3 8B Cpt Sea Lionv2 Instruct93.66
14Llama 3 8B Cpt Sea Lionv2.1 Instruct93.61
15Llama 3 8B Instruct92.1

Interactive version: theaggregate.ai/benchmark?slug=seaeval-cross-lingual-consistency-cross-xquad-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.