SeaLLM-7B-v2.5 — benchmark results
Alibaba DAMO's Gemma-7B-based SeaLLM (April 2024) fine-tuned for Southeast Asian languages such as Vietnamese, Thai, and Indonesian. Provider: Sea AI Lab. Released 2024-04-10. Access: Open.
Unified ELO 1433 ± 22, rank #1075 of 1776 rated models, from 150 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment NO Neutral Task | 80.69 | Accuracy (%) | 85.8 |
| Open Arabic LLM - Arabic MMLU Arabic Language (Grammar) | 50.41 | Accuracy (%) | 80.6 |
| Open Arabic LLM - Arabic MMLU HT Abstract Algebra | 36 | Accuracy (%) | 76.9 |
| Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task | 91.33 | Accuracy (%) | 76.5 |
| Open Arabic LLM - Madinah QA Arabic Language (Grammar) | 50.14 | Accuracy (%) | 75.9 |
| Open Arabic LLM - Arabic MMLU HT Electrical Engineering | 57.24 | Accuracy (%) | 74.1 |
| Open Arabic LLM - Madinah QA Average | 57.99 | Accuracy (%) | 71 |
| Open Medical LLM - PubMedQA | 75 | Accuracy (%) | 69.3 |
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment Task | 53.13 | Accuracy (%) | 69.1 |
| Open Arabic LLM - Arabic MMLU HT Virology | 47.59 | Accuracy (%) | 68.2 |
| Open Arabic LLM - Aratrust Ethics | 73.33 | Accuracy (%) | 67.7 |
| Open Korean LLM Leaderboard | 313.05 | Average Score (%) | 67.6 |
Interactive version: theaggregate.ai/model?slug=seallm-7b-v2-5 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.