llama-3-typhoon-v1.5-8B-instruct: benchmark results
Provider: Meta. Access: Open.
Unified ELO 1441 ± 1, rank #984 of 1392 rated models, from 35 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Thai LLM NLG - xl_sum_tha_seacrowd_t2t (ROUGE1) | 29.71 | ROUGE1 | 79.1 |
| Thai LLM NLG - xl_sum_tha_seacrowd_t2t (ROUGE2) | 10.4 | ROUGE2 | 77.6 |
| Thai LLM NLG - iapp_squad_seacrowd_qa (ROUGE1) | 56.66 | ROUGE1 | 76.1 |
| Thai LLM NLG - iapp_squad_seacrowd_qa (ROUGE2) | 44.22 | ROUGE2 | 76.1 |
| Thai LLM NLG - iapp_squad_seacrowd_qa (ROUGEL) | 55.99 | ROUGEL | 76.1 |
| Thai LLM NLG - xl_sum_tha_seacrowd_t2t (ROUGEL) | 19.73 | ROUGEL | 74.6 |
| Thai LLM - Writing | 6.6 | Rating (0-10) | 63.4 |
| Thai LLM - STEM | 6.05 | Rating (0-10) | 56.3 |
| Thai LLM - Reasoning | 4.8 | Rating (0-10) | 54.9 |
| Open Chinese LLM - TruthfulQA MC | 53.41 | Accuracy (%) | 47.8 |
| Thai LLM - Knowledge III | 3.7 | Rating (0-10) | 46.5 |
| Thai LLM NLU - wisesight_thai_sentiment_seacrowd_text | 41.3 | Accuracy (%) | 44.9 |
Interactive version: theaggregate.ai/model?slug=llama-3-typhoon-v1-5-8b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.