T5-Large: benchmark results

Provider: Other. Access: Open.

Unified ELO 1227 ± 42, rank #2604 of 2656 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BoolQ85.4Accuracy (%)71.4
Epoch AI - Superglue82.7Score57.1
Epoch AI - Common Sense Qa 254.6Score33.3
InstructEval - Alignment (HHH)47.7Average (%, harmless/helpful/honest)12
Open Portuguese LLM - OAB Exams20.09Accuracy (%)5.2
Open Portuguese LLM - BLUEX13.49Accuracy (%)4.5
Open Portuguese LLM - ENEM15.47Accuracy (%)4.1
Open Portuguese LLM - FaQuAD NLI10.46Macro F1 (%)2.7
Open Portuguese LLM - ASSIN2 RTE19.68Macro F1 (%)2.6
BIRD-SQL20.94Execution Accuracy (%)1.9

Interactive version: theaggregate.ai/model?slug=t5-large · How It Works · Data refreshed daily, snapshot 2026-09-19.