SEA-HELM (Thai) - Causal Reasoning: leaderboard

Metric: Normalized Score. Source: leaderboard.sea-lion.ai. 44 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)96.83
2Gemma 4 26B A4B (IT)92.26
3Llama 3.3 70B Instruct92
4Gemma 4 12B (IT)91.75
5Qwen 3.5 27B90.86
6Qwen 3.6 27B90.77
7Qwen 3 VL 32B Instruct88.9
8Qwen 3.5 122B A10B88.88
9Llama 4 Scout Instruct88.41
10Gemma 3 27B (IT)87.9
11Gemma 3 12B (IT)85.94
12gemma-4-E4B-it82.78
13Qwen 3 VL 8B Instruct81.64
14Qwen 3.6 35B A3B80.12
15Mistral Medium 3.578.19

Interactive version: theaggregate.ai/benchmark?slug=sea-helm-thai-causal-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.