SEA-HELM (Filipino) - Causal Reasoning: leaderboard

Metric: Normalized Score. Source: leaderboard.sea-lion.ai. 44 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)94.67
2Gemma 4 26B A4B (IT)91.96
3Gemma 4 12B (IT)91.03
4Llama 4 Scout Instruct87.98
5Gemma 3 27B (IT)87.91
6Llama 3.3 70B Instruct87.66
7gemma-4-E4B-it86.8
8Qwen 3.5 122B A10B86.55
9Gemma 3 12B (IT)86.13
10Qwen 3.6 27B85.52
11Qwen 3.5 27B84.67
12Qwen 3 VL 32B Instruct84.48
13Mistral Medium 3.581.74
14Qwen 3.6 35B A3B78.98
15Mistral Small 473.53

Interactive version: theaggregate.ai/benchmark?slug=sea-helm-filipino-causal-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.