gpt-j-6B: benchmark results

Provider: EleutherAI. Released 2021-06-09. Access: Open.

Unified ELO 1269 ± 1, rank #1374 of 1392 rated models, from 109 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Classic - BLiMP83.4Exact Match (%)90.3
MMLU-by-task - Machine Learning38.39Accuracy (%)75.4
HELM Classic - Synthetic Reasoning Natural19.88F1 (%)60.3
HELM Classic - MATH11.08Equivalent (%)57.4
HELM Classic - IMDB93.87Exact Match (%)56.1
MMLU-by-task - High School Mathematics27.41Accuracy (%)54.6
MMLU-by-task - College Mathematics32Accuracy (%)53.6
MMLU-by-task - Econometrics28.07Accuracy (%)47.2
HELM Classic - RAFT61.89Exact Match (%)47
HELM Classic - MATH Chain-of-Thought4.25Equivalent (%)44.1
HELM Classic - CNN/DailyMail13.11ROUGE-2 (%)39
HELM Classic - GSM8K3.6Exact Match (%)39

Interactive version: theaggregate.ai/model?slug=gpt-j-6b · How It Works · Data refreshed daily, snapshot 2026-09-05.