GPT-2 Large: benchmark results
Provider: OpenAI. Released 2019-08-20. Access: Open.
Unified ELO 1203 ± 40, rank #2625 of 2653 rated models, from 110 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AI Energy Score (Text Generation) | 5 | Energy Score (1-5) | 79.5 |
| StereoSet | 70.54 | ICAT Score | 60 |
| EuroEval Faroese NLU - ScaLA FO | 1.37 | Linguistic acceptability Score (%) | 37 |
| Open LLM Leaderboard - MuSR | 37.89 | Score | 28.8 |
| EuroEval Danish NLU - ScaLA DA | 0.58 | Linguistic acceptability Score (%) | 18.6 |
| EuroEval English NLU - SQuAD | 45.93 | Reading comprehension Score (%) | 18.1 |
| EuroEval German NLU - ScaLA DE | 2.72 | Linguistic acceptability Score (%) | 17.6 |
| EuroEval Icelandic NLU - ScaLA IS | 0 | Linguistic acceptability Score (%) | 17.4 |
| Open Portuguese LLM - FaQuAD NLI | 43.97 | Macro F1 (%) | 17.1 |
| EuroEval Swedish NLU - ScaLA SV | 0.82 | Linguistic acceptability Score (%) | 16 |
| Open LLM Leaderboard - IFEval | 20.48 | Score | 12.6 |
| Open LLM Leaderboard - GPQA | 25.92 | Score | 11.8 |
Interactive version: theaggregate.ai/model?slug=gpt-2-large · How It Works · Data refreshed daily, snapshot 2026-09-21.