Falcon3-1B-Instruct: benchmark results
Provider: TII. Released 2024-12-17. Access: Open.
Unified ELO 1268 ± 25, rank #2544 of 2656 rated models, from 106 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| BFCL V4 - Irrelevance Detection | 87.3 | Accuracy (%) | 79.3 |
| MEDIC Benchmark | 69.39 | MEDIC Public Table Average | 73.7 |
| Open LLM Leaderboard - IFEval | 55.57 | Score | 67.2 |
| Open LLM Leaderboard - MuSR | 41.89 | Score | 59.5 |
| Open LLM Leaderboard - MATH Level 5 | 6.34 | Score | 34.6 |
| Open Portuguese LLM - FaQuAD NLI | 51.95 | Macro F1 (%) | 33.4 |
| EuroEval Portuguese NLU - MultiWikiQA PT | 52.49 | Reading comprehension Score (%) | 29.7 |
| Open Portuguese LLM - ASSIN2 RTE | 76.08 | Macro F1 (%) | 27.8 |
| Open Portuguese LLM - BLUEX | 31.57 | Accuracy (%) | 27.6 |
| Open Portuguese LLM - ENEM | 34.57 | Accuracy (%) | 27.3 |
| Open Portuguese LLM - OAB Exams | 30.84 | Accuracy (%) | 27.1 |
| EuroEval Portuguese NLU - ScaLA PT | 2.08 | Linguistic acceptability Score (%) | 25.2 |
Interactive version: theaggregate.ai/model?slug=falcon3-1b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-19.