Llama 3.2 1B Instruct: benchmark results
Instruction-tuned Llama 3.2 1B checkpoint. Provider: Meta. Released 2024-09-25. Access: Open.
Unified ELO 1334 ± 1, rank #1295 of 1392 rated models, from 507 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Enkrypt AI - Jailbreak Risk | 3.22 | Risk Score | 85.3 |
| Thai LLM NLG - xl_sum_tha_seacrowd_t2t (ROUGE1) | 31.06 | ROUGE1 | 83.6 |
| Thai LLM NLG - xl_sum_tha_seacrowd_t2t (ROUGEL) | 21.33 | ROUGEL | 83.6 |
| Enkrypt AI - Toxicity Risk | 1.18 | Risk Score | 79.8 |
| Open LLM Leaderboard - IFEval | 58.1 | Score | 69.9 |
| Thai LLM NLG - xl_sum_tha_seacrowd_t2t (ROUGE2) | 9.77 | ROUGE2 | 67.2 |
| MERA - ruHumanEval | 18.72 | pass@1 (%) | 62.7 |
| Thai LLM NLG - iapp_squad_seacrowd_qa (ROUGE1) | 46.39 | ROUGE1 | 62.7 |
| Thai LLM NLG - iapp_squad_seacrowd_qa (ROUGEL) | 45.77 | ROUGEL | 62.7 |
| BlueBench - Summarization | 17.62 | Score (%) | 58.8 |
| LA Leaderboard - Spanish Law Exams | 31.09 | Accuracy (%) | 58.8 |
| Thai LLM NLG - iapp_squad_seacrowd_qa (ROUGE2) | 32.43 | ROUGE2 | 58.2 |
Interactive version: theaggregate.ai/model?slug=llama-3-2-1b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.