Falcon3-3B-Base: benchmark results

Provider: TII. Access: Open.

Unified ELO 1311 ± 28, rank #2415 of 2656 rated models, from 92 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Swallow - Pre-trained English - GSM8K63.4Exact Match (%)57.1
Swallow - Pre-trained English - MATH34.4Exact Match (%)57.1
Open LLM Leaderboard - MATH Level 511.78Score53.1
Open LLM Leaderboard - GPQA29.7Score52.6
Swallow - Pre-trained English - BBH54.7Exact Match (%)51
Swallow - Pre-trained English - HumanEval34.8Pass@1 (%)46.9
EuroEval Portuguese NLU - HAREM40.03Named entity recognition Score (%)45.2
Swallow - Pre-trained English - Average49.4Average Score (%)44.9
EuroEval Portuguese NLU - SST-2 PT73.48Sentiment classification Score (%)43.2
Open Portuguese LLM - FaQuAD NLI58.64Macro F1 (%)42.6
Open Portuguese LLM - OAB Exams39.36Accuracy (%)41.1
Swallow - Pre-trained English - SQuAD250.3Exact Match (%)39.8

Interactive version: theaggregate.ai/model?slug=falcon3-3b-base · How It Works · Data refreshed daily, snapshot 2026-09-19.