flan-ul2: benchmark results
Provider: Google. Released 2023-03-03. Access: API.
Unified ELO 1449 ± 1, rank #953 of 1392 rated models, from 8 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| InstructEval - Problem Solving | 51.6 | Average (%, MMLU/BBH/DROP/CRASS/HumanEval) | 98 |
| InstructEval - Alignment (HHH) | 78.2 | Average (%, harmless/helpful/honest) | 92 |
| Open LLM Leaderboard - BBH | 30.02 | Score | 51.8 |
| Open LLM Leaderboard - GPQA | 5.03 | Score | 42.5 |
| Open LLM Leaderboard - MuSR | 5.58 | Score | 27.1 |
| Open LLM Leaderboard - MMLU-Pro | 16.59 | Score | 25.6 |
| Open LLM Leaderboard - IFEval | 23.93 | Score | 17.8 |
| Open LLM Leaderboard - MATH Level 5 | 0.91 | Score | 6.5 |
Interactive version: theaggregate.ai/model?slug=flan-ul2 · How It Works · Data refreshed daily, snapshot 2026-09-05.