gpt2-large — benchmark results

Provider: OpenAI. Released 2019-08-20. Access: API.

Unified ELO 921 ± 42, rank #1775 of 1776 rated models, from 100 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AI Energy Score (Text Generation)5Energy Score (1-5)79.5
EuroEval Faroese NLU - ScaLA FO1.37Linguistic acceptability Score (%)37
Open LLM Leaderboard - MuSR5.66Score27.5
EuroEval Danish NLU - ScaLA DA0.58Linguistic acceptability Score (%)18.6
EuroEval English NLU - SQuAD45.93Reading comprehension Score (%)18.1
EuroEval German NLU - ScaLA DE2.72Linguistic acceptability Score (%)17.6
EuroEval Icelandic NLU - ScaLA IS0Linguistic acceptability Score (%)17.4
EuroEval Swedish NLU - ScaLA SV0.82Linguistic acceptability Score (%)16
Open LLM Leaderboard - IFEval20.48Score12.6
Open LLM Leaderboard - GPQA1.23Score11.8
EuroEval French Knowledge0.41Knowledge Average Score (%)10.8
EuroEval Italian NLU - ScaLA IT0.24Linguistic acceptability Score (%)10.4

Interactive version: theaggregate.ai/model?slug=gpt2-large · How the rankings work · Data refreshed daily, snapshot 2026-07-22.