flan-t5-large: benchmark results

Provider: Google. Released 2022-10-21. Access: API.

Unified ELO 1368 ± 1, rank #1224 of 1392 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
InstructEval - Problem Solving41Average (%, MMLU/BBH/DROP/CRASS/HumanEval)75.5
InstructEval - Alignment (HHH)70.4Average (%, harmless/helpful/honest)68
ConvRe - Re2Text Hard26.2Accuracy (%)44.4
ConvRe - Text2Re Hard29.6Accuracy (%)44.4
Open LLM Leaderboard - MuSR9.01Score43.5
ConvRe51.2Average Score (%)33.3
ConvRe - Text2Re Easy77.3Accuracy (%)33.3
Open LLM Leaderboard - BBH17.51Score26.4
ConvRe - Re2Text Easy71.5Accuracy (%)22.2
Open LLM Leaderboard - MMLU-Pro7.88Score18.3
Open LLM Leaderboard - IFEval22.01Score15
Open LLM Leaderboard - MATH Level 51.44Score10.6

Interactive version: theaggregate.ai/model?slug=flan-t5-large · How It Works · Data refreshed daily, snapshot 2026-09-05.