falcon-7B — benchmark results
Provider: TII. Released 2023-05-25. Access: Open.
Unified ELO 1196 ± 16, rank #1696 of 1776 rated models, from 86 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HELM Classic - WikiFact | 30.87 | Exact Match (%) | 68.2 |
| OpenEval - XSum | 23.11 | ROUGE-L | 58.3 |
| HELM Classic - MATH | 10.84 | Equivalent (%) | 55.9 |
| HellaSwag | 78.1 | Accuracy (%) | 55.9 |
| HELM Classic - TruthfulQA | 23.39 | Exact Match (%) | 53.8 |
| Epoch AI - Lambada | 74.9 | Score | 52 |
| HELM Classic - BoolQ | 75.3 | Exact Match (%) | 51.5 |
| HELM Classic - NaturalQuestions Closed Book | 28.52 | F1 (%) | 51.5 |
| HELM Classic - LSAT | 20.43 | Exact Match (%) | 48.5 |
| OpenEval - CNN/DailyMail | 23.09 | ROUGE-L | 47.1 |
| HELM Classic - RAFT | 60.23 | Exact Match (%) | 43.9 |
| HELM Classic - MATH Chain-of-Thought | 4.21 | Equivalent (%) | 42.6 |
Interactive version: theaggregate.ai/model?slug=falcon-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.