SEA-HELM (Indonesian) - Causal Reasoning: leaderboard

Metric: Normalized Score. Source: leaderboard.sea-lion.ai. 44 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)95.63
2Qwen 3.5 122B A10B94
3Qwen 3 VL 32B Instruct93.6
4Qwen 3.6 27B93.36
5Llama 3.3 70B Instruct93.07
6Qwen 3.5 27B93
7Gemma 4 26B A4B (IT)92.67
8Qwen 3.6 35B A3B91.88
9Mistral Medium 3.591.81
10Gemma 4 12B (IT)91.2
11Llama 4 Scout Instruct90.63
12Gemma 3 27B (IT)90.21
13Gemma 3 12B (IT)89.55
14Qwen 3 VL 8B Instruct88.1
15gemma-4-E4B-it86.83

Interactive version: theaggregate.ai/benchmark?slug=sea-helm-indonesian-causal-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.