Thai LLM NLU - xnli.tha_seacrowd_pairs: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 70 models tracked.

Top models

#ModelScore
1GPT-4o (2024-05-13)57.54
2Claude 3.5 Sonnet (20240620)55.69
3GPT-4o Mini (2024-07-18)52.06
4gemma2-9B-cpt-sea-lionv3-instruct47.54
5Qwen 2.5 72B Instruct44.65
6Gemma 2 9B (IT)43.93
7Tsunami-1.0-14B-Instruct42.57
8Tsunami-0.5x-7B-Instruct41.96
9QwQ 32B-Preview41.34
10Tsunami-1.0-7B-Instruct41.04
11Qwen 2.5 14B Instruct40.88
12Qwen 2.5 7B Instruct40.82
13Qwen 2 7B Instruct39.2
14Tsunami-0.5-7B-Instruct39.18
15Qwen 2 72B Instruct37.58

Interactive version: theaggregate.ai/benchmark?slug=thai-llm-nlu-xnli-tha-seacrowd-pairs · How It Works · Data refreshed daily, snapshot 2026-09-05.