SeaLLMs-v3-7B-Chat: benchmark results
Alibaba DAMO Academy's Southeast Asian chat model built on Qwen2-7B, covering 12 regional languages from Indonesian to Burmese (July 2024). Provider: Sea AI Lab. Released 2024-07-03. Access: Open.
Unified ELO 1489 ± 1, rank #739 of 1392 rated models, from 199 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment NO Neutral Task | 81.06 | Accuracy (%) | 89.5 |
| SeaEval - Cultural Reasoning - SG-Eval v2 Open (Zero-Shot) | 55 | Accuracy (%) | 89.1 |
| Open Arabic LLM - Alghafa Multiple Choice Sentiment Task | 42.44 | Accuracy (%) | 88.6 |
| SeaEval - Multilingual Reasoning - C-Eval (Zero-Shot) | 76.59 | Accuracy (%) | 82.6 |
| Thai LLM NLG - xl_sum_tha_seacrowd_t2t (ROUGE1) | 29.97 | ROUGE1 | 80.6 |
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment Task | 54.5 | Accuracy (%) | 79.9 |
| SeaEval - Cultural Reasoning - CN-Eval (Zero-Shot) | 81.9 | Accuracy (%) | 79.2 |
| Thai LLM NLG - xl_sum_tha_seacrowd_t2t (ROUGEL) | 20.27 | ROUGEL | 79.1 |
| Open Korean LLM Leaderboard | 41.02 | Average Score (%) | 77.8 |
| SeaEval - Cultural Reasoning - SG-Eval (Zero-Shot) | 71.84 | Accuracy (%) | 76.2 |
| SeaEval - Multilingual Reasoning - CMMLU (Zero-Shot) | 76.84 | Accuracy (%) | 76.2 |
| SeaEval - Dialogue - SAMSum (Zero-Shot) | 29.6 | Average ROUGE (0-100) | 75 |
Interactive version: theaggregate.ai/model?slug=seallms-v3-7b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.