GPT-2 XL: benchmark results
Provider: OpenAI. Released 2019-11-05. Access: Open.
Unified ELO 1163 ± 19, rank #1562 of 1605 rated models, from 95 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AI Energy Score (Text Generation) | 4 | Energy Score (1-5) | 47.5 |
| HELM AFR - MMLU Virology (Tswana) | 30.72 | EM | 38.1 |
| HELM AFR - Winogrande (Zulu) | 50.65 | EM | 38.1 |
| HELM AFR - MMLU Virology (Northern Sotho) | 31.33 | EM | 33.3 |
| HELM AFR - Winogrande (Bambara) | 50.08 | EM | 33.3 |
| HELM AFR - MMLU Clinical Knowledge (Bambara) | 26.79 | EM | 28.6 |
| HELM AFR - Winogrande (Amharic) | 49.52 | EM | 28.6 |
| Open LLM Leaderboard - MuSR | 37.1 | Score | 24.6 |
| HELM AFR - MMLU Virology (Igbo) | 28.31 | EM | 23.8 |
| HELM AFR - Winogrande (Southern Sotho) | 49.8 | EM | 23.8 |
| HELM AFR - MMLU Clinical Knowledge (Tsonga) | 28.3 | EM | 19 |
| Open Portuguese LLM - FaQuAD NLI | 43.97 | Macro F1 (%) | 17.1 |
Interactive version: theaggregate.ai/model?slug=gpt-2-xl · How It Works · Data refreshed daily, snapshot 2026-09-26.