T5-Large: benchmark results
Provider: Other. Access: Open.
Unified ELO 1227 ± 42, rank #2604 of 2656 rated models, from 10 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| BoolQ | 85.4 | Accuracy (%) | 71.4 |
| Epoch AI - Superglue | 82.7 | Score | 57.1 |
| Epoch AI - Common Sense Qa 2 | 54.6 | Score | 33.3 |
| InstructEval - Alignment (HHH) | 47.7 | Average (%, harmless/helpful/honest) | 12 |
| Open Portuguese LLM - OAB Exams | 20.09 | Accuracy (%) | 5.2 |
| Open Portuguese LLM - BLUEX | 13.49 | Accuracy (%) | 4.5 |
| Open Portuguese LLM - ENEM | 15.47 | Accuracy (%) | 4.1 |
| Open Portuguese LLM - FaQuAD NLI | 10.46 | Macro F1 (%) | 2.7 |
| Open Portuguese LLM - ASSIN2 RTE | 19.68 | Macro F1 (%) | 2.6 |
| BIRD-SQL | 20.94 | Execution Accuracy (%) | 1.9 |
Interactive version: theaggregate.ai/model?slug=t5-large · How It Works · Data refreshed daily, snapshot 2026-09-19.