GPT-2 XL: benchmark results

Provider: OpenAI. Released 2019-11-05. Access: Open.

Unified ELO 1163 ± 19, rank #1562 of 1605 rated models, from 95 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AI Energy Score (Text Generation)4Energy Score (1-5)47.5
HELM AFR - MMLU Virology (Tswana)30.72EM38.1
HELM AFR - Winogrande (Zulu)50.65EM38.1
HELM AFR - MMLU Virology (Northern Sotho)31.33EM33.3
HELM AFR - Winogrande (Bambara)50.08EM33.3
HELM AFR - MMLU Clinical Knowledge (Bambara)26.79EM28.6
HELM AFR - Winogrande (Amharic)49.52EM28.6
Open LLM Leaderboard - MuSR37.1Score24.6
HELM AFR - MMLU Virology (Igbo)28.31EM23.8
HELM AFR - Winogrande (Southern Sotho)49.8EM23.8
HELM AFR - MMLU Clinical Knowledge (Tsonga)28.3EM19
Open Portuguese LLM - FaQuAD NLI43.97Macro F1 (%)17.1

Interactive version: theaggregate.ai/model?slug=gpt-2-xl · How It Works · Data refreshed daily, snapshot 2026-09-26.