GPT-2 Medium — benchmark results
Provider: OpenAI. Released 2019-05-03. Access: API.
Unified ELO 929 ± 38, rank #1774 of 1776 rated models, from 101 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AI Energy Score (Text Generation) | 5 | Energy Score (1-5) | 79.5 |
| StereoSet | 71.73 | ICAT Score | 77.8 |
| EuroEval Icelandic Common Sense Reasoning | 3.57 | Common Sense Reasoning Average Score (%) | 38.4 |
| Open LLM Leaderboard - MuSR | 6.16 | Score | 29.6 |
| EuroEval Spanish NLU - ScaLA ES | 0.73 | Linguistic acceptability Score (%) | 26.3 |
| EuroEval Norwegian NLU - ScaLA NN | 1.06 | Linguistic acceptability Score (%) | 18.7 |
| Open LLM Leaderboard - GPQA | 1.68 | Score | 16.5 |
| EuroEval Portuguese NLU - ScaLA PT | 0.62 | Linguistic acceptability Score (%) | 16.4 |
| Open LLM Leaderboard - IFEval | 22.08 | Score | 15.1 |
| EuroEval English NLU - SQuAD | 38.64 | Reading comprehension Score (%) | 15 |
| EuroEval Swedish NLU - ScaLA SV | 0.21 | Linguistic acceptability Score (%) | 12.8 |
| EuroEval German Knowledge | 0.79 | Knowledge Average Score (%) | 11.7 |
Interactive version: theaggregate.ai/model?slug=gpt-2-medium · How the rankings work · Data refreshed daily, snapshot 2026-07-22.