flan-t5-xl: benchmark results

Provider: Google. Released 2022-10-21. Access: API.

Unified ELO 1398 ± 1, rank #1143 of 1392 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ConvRe - Re2Text Easy91.5Accuracy (%)88.9
InstructEval - Problem Solving47.4Average (%, MMLU/BBH/DROP/CRASS/HumanEval)87.8
InstructEval - Alignment (HHH)75Average (%, harmless/helpful/honest)84
ConvRe - Text2Re Easy90.6Accuracy (%)77.8
Open LLM Leaderboard - MuSR11.85Score63.8
ConvRe52Average Score (%)44.4
Open LLM Leaderboard - BBH22.84Score34.3
Open LLM Leaderboard - MMLU-Pro12.74Score22.5
ConvRe - Text2Re Hard17.8Accuracy (%)22.2
Open LLM Leaderboard - IFEval22.37Score15.4
Open LLM Leaderboard - GPQA0.34Score6.3
Open LLM Leaderboard - MATH Level 50.76Score5.6

Interactive version: theaggregate.ai/model?slug=flan-t5-xl · How It Works · Data refreshed daily, snapshot 2026-09-05.