SEA-HELM (Filipino) - Natural Language Inference: leaderboard

Metric: Normalized Score. Source: leaderboard.sea-lion.ai. 44 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)68.2
2Qwen 3.5 27B62.66
3Gemma 4 26B A4B (IT)60.62
4Qwen 3.5 122B A10B59.46
5Qwen 3 VL 32B Instruct59.37
6Llama 3.3 70B Instruct59.04
7Gemma 3 27B (IT)54.97
8Gemma 3 12B (IT)54.49
9gemma-4-E4B-it52.3
10Qwen 3.6 27B51.22
11Llama 4 Scout Instruct49.19
12Gemma 3 4B (IT)48.37
13Mistral Medium 3.545.53
14Qwen 3 VL 8B Instruct44.46
15Qwen 3.5 35B A3B38.72

Interactive version: theaggregate.ai/benchmark?slug=sea-helm-filipino-natural-language-inference · How It Works · Data refreshed daily, snapshot 2026-09-19.