GPT-2 — benchmark results

Provider: OpenAI. Released 2019-02-14. Access: API.

Unified ELO 901 ± 41, rank #1776 of 1776 rated models, from 114 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
StereoSet72.97ICAT Score100
Open LLM Leaderboard - MuSR18.33Score90.7
AI Energy Score (Text Generation)5Energy Score (1-5)79.5
EuroEval Faroese NLU - ScaLA FO0.79Linguistic acceptability Score (%)31.1
EuroEval Spanish NLU - ScaLA ES0.01Linguistic acceptability Score (%)19.3
Open LLM Leaderboard - BBH9.2Score19
EuroEval Portuguese NLU - ScaLA PT0.91Linguistic acceptability Score (%)18.2
EuroEval Norwegian NLU - ScaLA NN0.84Linguistic acceptability Score (%)16.3
EuroEval Italian NLU - ScaLA IT1.07Linguistic acceptability Score (%)14.9
EuroEval Icelandic Common Sense Reasoning-0.05Common Sense Reasoning Average Score (%)13.3
Open LLM Leaderboard - GPQA1.34Score13.2
EuroEval Spanish Knowledge1.03Knowledge Average Score (%)12.7

Interactive version: theaggregate.ai/model?slug=gpt-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.