flan-ul2: benchmark results

Provider: Google. Released 2023-03-03. Access: API.

Unified ELO 1449 ± 1, rank #953 of 1392 rated models, from 8 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
InstructEval - Problem Solving51.6Average (%, MMLU/BBH/DROP/CRASS/HumanEval)98
InstructEval - Alignment (HHH)78.2Average (%, harmless/helpful/honest)92
Open LLM Leaderboard - BBH30.02Score51.8
Open LLM Leaderboard - GPQA5.03Score42.5
Open LLM Leaderboard - MuSR5.58Score27.1
Open LLM Leaderboard - MMLU-Pro16.59Score25.6
Open LLM Leaderboard - IFEval23.93Score17.8
Open LLM Leaderboard - MATH Level 50.91Score6.5

Interactive version: theaggregate.ai/model?slug=flan-ul2 · How It Works · Data refreshed daily, snapshot 2026-09-05.