SEA-SpeechBench - ASR: leaderboard

Metric: Word or character error rate (raw ratio, lower is better; WER, or CER for languages without explicit word boundaries, averaged over the source test sets of each language and then over the 11 languages (English, Filipino, Vietnamese, Indonesian, Tamil, Thai, Chinese, Khmer, Lao, Malay and Burmese); short clips of at most 30 s from curated public Southeast Asian speech corpora, up to 1,000 sampled items per dataset; English instruction prompt; exceeds 1 when a hypothesis is much longer than its reference). Source: arxiv.org. Saturation forecast: Around October 2026. 14 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash0.15
2Qwen3 Omni 30B A3B Instruct0.56
3SeaLLMs-Audio-7B0.72
4Qwen2-Audio-7B-Instruct1
5Gemma 3n E4B (IT)1.14
6Qwen2.5-Omni-7B1.33
7Voxtral-Mini-3B-25071.36
8gemma-3n-E2B-it1.88
9Phi-4 Multimodal Instruct2.43

Interactive version: theaggregate.ai/benchmark?slug=sea-speechbench-asr · How It Works · Data refreshed daily, snapshot 2026-09-26.