Falcon3-3B-Instruct: benchmark results

Provider: TII. Released 2024-12-17. Access: Open.

Unified ELO 1343 ± 20, rank #2270 of 2656 rated models, from 107 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval69.77Score82.8
MEDIC Benchmark75.28MEDIC Public Table Average82.1
Open LLM Leaderboard - MATH Level 525Score78.1
EuroEval Portuguese NLU - HAREM44.97Named entity recognition Score (%)61.8
Open Portuguese LLM - FaQuAD NLI70.01Macro F1 (%)60.2
EuroEval Portuguese NLU - MultiWikiQA PT70.43Reading comprehension Score (%)59.4
EuroEval Portuguese NLU - ScaLA PT14.58Linguistic acceptability Score (%)53.9
Open LLM Leaderboard - MuSR41.36Score53.6
BFCL V4 - Relevance Detection81.25Accuracy (%)50
EuroEval Portuguese NLU49.39NLU Average Score (%)49.2
EuroEval Portuguese41.48Average Score (%)46.1
Open LLM Leaderboard - GPQA28.86Score43.2

Interactive version: theaggregate.ai/model?slug=falcon3-3b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-19.