SEA-HELM (Burmese) - Causal Reasoning: leaderboard

Metric: Normalized Score. Source: leaderboard.sea-lion.ai. 44 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)76.9
2Gemma 4 26B A4B (IT)69.56
3Llama 4 Scout Instruct69.19
4Qwen 3.5 122B A10B65.41
5Gemma 4 12B (IT)65.11
6Qwen 3.6 27B60.99
7Qwen 3.5 27B59.67
8Gemma 3 27B (IT)58.78
9gemma-4-E4B-it52.98
10Qwen 3 VL 32B Instruct50.23
11Gemma 3 12B (IT)44.11
12Mistral Medium 3.539.06
13Qwen 3 VL 8B Instruct36.71
14Gemma 4 E2B (IT)34.27
15Qwen 3 VL 4B Instruct23.6

Interactive version: theaggregate.ai/benchmark?slug=sea-helm-burmese-causal-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.