gpt2-medium-emailgen: benchmark results

Provider: OpenAI. Access: API.

Unified ELO 1197 ± 20, rank #2906 of 2928 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR39.11Score35.7
Open LLM Leaderboard v1 - TruthfulQA MC243.96MC2 (%) (0-shot)25.4
Open LLM Leaderboard - GPQA26.01Score13.2
Open LLM Leaderboard - BBH31.3Score8.7
Open LLM Leaderboard v1 - HellaSwag34.31Normalized accuracy (%) (10-shot)7
Open LLM Leaderboard - MMLU-Pro11.47Score6.5
Open LLM Leaderboard v1 - ARC Challenge26.45Normalized accuracy (%) (25-shot)5.8
Open LLM Leaderboard - IFEval14.92Score4.9
Open LLM Leaderboard v1 - GSM8K0Accuracy (%) (5-shot)4.6
Open LLM Leaderboard v1 - WinoGrande50.43Accuracy (%) (5-shot)3.6
Open LLM Leaderboard v1 - MMLU24.1Accuracy (%) (5-shot)2.9
Open LLM Leaderboard - MATH Level 50Score1.3

Interactive version: theaggregate.ai/model?slug=gpt2-medium-emailgen · How It Works · Data refreshed daily, snapshot 2026-09-23.