SEA-HELM (Thai) - Natural Language Inference: leaderboard

Metric: Normalized Score. Source: leaderboard.sea-lion.ai. 44 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)62.59
2Gemma 4 26B A4B (IT)54.47
3Llama 3.3 70B Instruct53.41
4Qwen 3.6 27B51.89
5Qwen 3 VL 32B Instruct51.02
6Qwen 3.5 27B49.56
7Gemma 3 12B (IT)49.51
8Gemma 3 27B (IT)49.22
9Gemma 4 12B (IT)44.25
10Mistral Medium 3.544.22
11Qwen 3 VL 4B Instruct42.87
12Qwen 3.5 35B A3B42.49
13Qwen 3 VL 8B Instruct42.16
14Qwen 3.6 35B A3B41.97
15Qwen 3.5 122B A10B40.37

Interactive version: theaggregate.ai/benchmark?slug=sea-helm-thai-natural-language-inference · How It Works · Data refreshed daily, snapshot 2026-09-19.