SEA-HELM (Burmese) - Natural Language Inference: leaderboard

Metric: Normalized Score. Source: leaderboard.sea-lion.ai. 44 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)59.07
2Gemma 3 27B (IT)55.54
3Gemma 4 26B A4B (IT)54.41
4Gemma 4 12B (IT)50
5Qwen 3.5 122B A10B46.56
6Qwen 3.5 27B46.24
7Qwen 3 VL 32B Instruct45.65
8Llama 3.3 70B Instruct42.63
9Qwen 3.6 35B A3B35.71
10Qwen 3.5 35B A3B33.85
11Llama 4 Scout Instruct32.84
12gemma-4-E4B-it32.55
13Qwen 3 VL 8B Instruct32.46
14Gemma 4 E2B (IT)30.92
15Gemma 3 4B (IT)29.2

Interactive version: theaggregate.ai/benchmark?slug=sea-helm-burmese-natural-language-inference · How It Works · Data refreshed daily, snapshot 2026-09-19.