Sailor-4B-Chat: benchmark results
Provider: Sea AI Lab. Access: Open.
Unified ELO 1341 ± 19, rank #2526 of 2928 rated models, from 14 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard v1 - GSM8K | 9.1 | Accuracy (%) (5-shot) | 29.6 |
| Open LLM Leaderboard v1 - MMLU | 43.96 | Accuracy (%) (5-shot) | 23.1 |
| Open LLM Leaderboard v1 - ARC Challenge | 45.05 | Normalized accuracy (%) (25-shot) | 20.6 |
| Open LLM Leaderboard v1 - WinoGrande | 66.22 | Accuracy (%) (5-shot) | 19.9 |
| Open LLM Leaderboard v1 - HellaSwag | 68.36 | Normalized accuracy (%) (10-shot) | 19.3 |
| Open LLM Leaderboard v1 - TruthfulQA MC2 | 42.09 | MC2 (%) (0-shot) | 19.3 |
| SEA LLM Leaderboard - SeaExam - Thai (Private) | 34 | Private Accuracy (%) | 15.6 |
| SEA LLM Leaderboard - SeaExam - Thai (Public) | 36 | Public Accuracy (%) | 15.6 |
| SEA LLM Leaderboard - SeaExam (Public) | 40.1 | Public Average Score (%) | 14.4 |
| SEA LLM Leaderboard - SeaExam - Vietnamese (Public) | 45.3 | Public Accuracy (%) | 14.4 |
| SEA LLM Leaderboard - SeaExam | 40.2 | Private Average Score (%) | 13.3 |
| SEA LLM Leaderboard - SeaExam - Indonesian (Private) | 41.2 | Private Accuracy (%) | 13.3 |
Interactive version: theaggregate.ai/model?slug=sailor-4b-chat · How It Works · Data refreshed daily, snapshot 2026-09-23.